第1765章遇到問題,分析問題,解決
第1765章遇到問題,分析問題,解決(第2/3頁)
個閾值。”
“計算量還是大。”張濤搖頭,“十萬網頁,矩陣就是一百億個元素。
現在的服務器算不動。”
第三天,陳浩打電話來了。
“遇到困難了?”他問。
賈瀞雯實話實說:“算力不夠。
團隊說矩陣太大,迭代計算需要的時間太長。”
電話那頭沉默了一會兒。
“可以簡化。”陳浩說,“第一,不需要算所有網頁。
隻計算有入鏈的網頁,那些孤立頁麵直接給最低分。
(本章未完,請點擊下一頁繼續閱讀)第1765章遇到問題,分析問題,解決問題(第2/2頁)
第二,迭代可以分批進行,不需要一次性算完。
第三,分數不需要精確到小數點後很多位,整數就行。”
賈瀞雯把這些記下來,轉告給團隊。
李明聽了,一拍大腿:“對啊!我們可以分塊計算!先把網頁按鏈接關係分組,組內迭代,組間再迭代。
這樣內存占用能降下來。”
思路打開了,進展就快了。
第一周結束時,他們做出了簡化版的超鏈分析算法。
測試數據很小,隻有一千個網頁,但結果令人鼓舞——重要網頁的分數確實高,垃圾網頁的分數確實低。
第二周,開始集成到真實數據裡。
問題又來了:十萬網頁的鏈接關係太複雜,計算一次要八個小時。
“太慢了。”張濤盯著屏幕,“如果每天都要重新計算,根本跟不上網頁更新的速度。”
賈瀞雯給陳浩打電話。
這次陳浩的建議很直接:“增量更新。
每天隻計算新增網頁和發生變化的部分,其他的用緩存。”
又是新的挑戰。
但團隊已經適應了這種節奏——遇到問題,分析問題,解決問題。
第二周周四晚上,李明從座位上跳起來。
“出來了!第一次完整計算完成!”
所有人圍過去。
屏幕上顯示著計算結果:十萬網頁,每個都有一個分數。
排在前麵的,確實是那些權威網站,新聞門戶,高校主頁。
排在後麵的,大多是個人主頁或者廣告頁麵。
“集成到排名算法裡測試一下。”賈瀞雯說。
李明敲了幾行代碼,啟動測試程序。
輸入幾個關鍵詞,搜索結果按新算法排序。
效果明顯。
之前搜“電腦價格”,前排結果裡總有幾個堆關鍵詞的垃圾頁麵。
現在那些頁麵不見了,取而代之的是真正的電腦報價網站。
“準確率!”張濤喊,“測試集準確率升到百分之六十二了!”
辦公室響起掌聲。
連續兩周的加班,值了。
周五,賈瀞雯讓大家休息一天。
她自己冇休息,去了中關村的一棟寫字樓。
公司該換個地方了。
現在那個八十平米的辦公室,六
(本章未完,請點擊下一頁繼續閱讀)