地元の図書館で、古い本のコレクションの整理を手伝う仕事に就きました。学生の利用者は、学期末レポートに引用したい、うろ覚えの一節を探していることがよくあります。1冊ずつ最初から最後まで手作業で読む代わりに、それらの本をスキャンして、そうしたうろ覚えの一節を探す小さなツールを作ることにしました。
ファイルから検索文字列に一致する行を探し、一致したすべての行を返します。
Unixのgrepコマンドは、正規表現に一致する行をファイルから探します。
ここでの課題は、固定文字列の検索に対応した簡略版のgrepコマンドを実装することです。
grepコマンドは3つの引数を取ります。
次に、指定されたファイルの内容を(指定された順に)読み込み、検索文字列を含む行を探し、最後に見つかった順にそれらの行を返します。
複数のファイルを検索する場合、一致した各行の先頭にはファイル名とコロン(:)が付きます。
grepコマンドは次のフラグに対応しています。
-n 出力の各行の先頭に行番号とコロン(:)を付けます。行番号はファイル名の後ろに置きます(ファイル名がある場合)。-l 一致する行を1つ以上含むファイルの名前だけを出力します。-i 大文字と小文字を区別せずに比較して照合します。-v プログラムの動作を反転させ、一致しなかったすべての行を集めます。-x 検索文字列が行全体と一致する行だけを探します。実装するもの:
grep ( pattern flags files -- lines )patternは検索する文字列、flagsは0個以上のフラグ文字列"-n"、"-l"、"-i"、"-v"、"-x"からなる配列、filesは1個以上のファイル名からなる配列です。一致した行を(指定されたファイル名と行番号の接頭辞があればそれも含めて)文字列の配列として返します。
-lフラグが指定されたときは、少なくとも1つ一致する行を含むファイルの名前の配列を返します。
ファイルの行は、エンコーディングを渡してfile-linesで読み込みます。
USING: io.encodings.utf8 io.files ;
"iliad.txt" utf8 file-lines
! => { "Achilles sing, O Goddess! Peleus' son;" ... }
3つのフィクスチャファイル(iliad.txt、midsummer-night.txt、paradise-lost.txt)は演習に同梱されていて作業ディレクトリにあります。そのため、名前を指定するだけでそのまま読み込めます。