親友のMartaは、最近、地元の歴史博物館のコレクションを扱う念願の仕事に就きました。 プログラミングに興味があることを知っているMartaは、コンピューティングの歴史に関する今度の展覧会に向けて、職場で困っていることを打ち明けてきました。 地元の大学の数学科が歴史的なプリントアウトを何箱か寄贈してくれたのですが、資料の状態が良くないため、そのテキストをデジタル化することになったのです。 ただ、大学の古いプリンターにはテキストの表現方法にちょっとした癖があり、データをうまく取り出すには助けが要りそうです。
Optical Character Recognition(OCR)は、文字の画像を機械が読み取れるテキストに変換するソフトウェアです。
数字を表す文字のグリッドが与えられたら、そのグリッドを数字の文字列に変換します。
グリッドに複数の行のセルがある場合は、出力ではそれぞれの行を","で区切ります。
"|")、アンダースコア("_")、スペース(" ")を使って描きます。"?"を出力する必要があります。次の入力(コメントを除く)は"1234567890"に変換されます。
_ _ _ _ _ _ _ _ #
| _| _||_||_ |_ ||_||_|| | # Decimal numbers.
||_ _| | _||_| ||_| _||_| #
# The fourth line is always blank,
次の入力は"123,456,789"に変換されます。
_ _
| _| _|
||_ _|
_ _
|_||_ |_
| _||_|
_ _ _
||_||_|
||_| _|
手順のステップ1で説明したとおりに関数recognizeDigitを定義します。ただし、0から9までの10個すべての数字を認識できるようにします。
引数と戻り値は好きなように決めてかまいませんが、ステップ2でサブルーチンとして使えるものにします。
ステップ2では、次の関数を定義します。
func Recognize(string) []string
そして、recognizeDigitを使ってこれを実装します。
ここでテストする入力文字列は、各行の先頭に\nがあり、最後の行には末尾の\nがありません。(こうすると、生文字列リテラルが読みやすくなります。)
さらに挑戦したい人は、形式の崩れたデータもうまく扱えるようにしてみましょう。
一部だけ欠けたセルはどう扱えばよいでしょうか? 捨てますか? スペースで埋めますか? それとも"?"という文字で報告しますか?
先頭の文字が\nでない場合はどうすればよいでしょうか?