Web上のデータを収集・解析してデータベース化したい。
定期的に再収集し、情報の更新を検知できるようにしたい。
IP分散や並列クローリングに対応し、今後のリクエスト増にも対応できる拡張性と高可用性を実現した。
また、参照先のサイトに過大な負荷をかけないようにするためのインターバル設定等にも対応。取得したデータは前回データと比較し、差異(更新)を検出できるようにした。
インフラにはAWSを使用し、今後のスケールアップ・スケールアウトも容易な構成とした。
| システム構成 | FreeBSD・apache・MySQL・PHP | 規模 | 5人月 |
|---|