デライトクローラの再開時に、ファイルに保存したメタデータを読み込むようにした
これでクロールを途中から再開できる
現時点では全メタデータを読み込む
メタデータの増加に合わせて、処理時間と消費メモリーが線形に増加する想定だ
こいつが膨大なデータを集めるまえに、よりかしこい処理方式を実装しなければならない
{クローラー}{クロールを途中から再開できるようにした}{デライトでクローラーを回す}{デライトの生HTMLファイル容量}{ページのメタ情報だけを保存}{メタ情報}{全輪郭の表題推定容量}(7)
{ページメタ情報の容量 K#EDD2/1E5F}
t_w=
15.718837606837608[KB]
=
0.015350427350427352[MB]
=
8.98 / 585 [MB]
関連するURLのリストを持つと、やはり容量が大きくなる
数だけ持つべきかもしれない
ページランクを無視するならURLは残さなくてもいい