第1745章一句話點醒了賈瀞雯
第1745章一句話點醒了賈瀞雯(第3/3頁)
前說的——第一版可以粗糙,但要快。
“我懂了。”她說,“先解決有冇有,再解決好不好的問題。”
“對。”陳浩笑了,“明天就這樣跟團隊說。
集中力量擴大爬蟲規模,優化抓取效率,把收錄量做上去。
至於速度和準確率,暫時放一放。”
電話打了半個多小時。
掛斷時,賈瀞雯覺得心裡踏實了很多。
她打開燈,拿出筆記本,開始寫新的工作計劃。
第二天開會,她把陳浩的策略傳達給團隊。
“陳總說,我們現階段的目標是收錄量。”賈瀞雯在白板上寫下“十萬網頁”四個字,“三周時間,把收錄量從一萬做到十萬。”
李明眼睛一亮:“這個思路對!現在我們總是糾結算法優化,但數據量太小,優化了也看不出效果。
先把數據堆上去,再談怎麼用好這些數據。”
張濤也點頭:“爬蟲部分其實可以改進。
我們現在是單線程抓取,太慢。
可以改多線程,同時抓多個頁麵。
還可以優化去重算法,減少重複抓取。”
“索引結構也要調整。”王磊說,“數據量大了,現在的結構肯定撐不住。
得設計新的存儲方案。”
團隊重新有了方向。
當天下午,他們就開始分工:李明負責優化爬蟲,張濤改進索引結構,王磊和其他兩人處理數據存儲和服務器擴展。
【跪求禮物,免費的為愛發電也行!】