第1741章彆被技術細節嚇住
第1741章彆被技術細節嚇住(第1/3頁)
第1741章彆被技術細節嚇住
辦公室的白板上寫滿了字。
李明的粉筆停在半空,眉頭皺成一個疙瘩。
他轉身看向另外四個同伴,又看看坐在會議桌旁的賈瀞雯。
“賈總,這個‘網頁爬蟲’的概念……我們研究了三天,還是有點不明白。”他放下粉筆,拍了拍手上的粉灰,“文檔上說,要讓程序像蜘蛛一樣在網上爬,自動發現和收集網頁。
但具體怎麼實現?”
張濤推了推眼鏡,翻開陳浩寫的技術框架文檔:“這裡寫了一些思路--從幾個種子網站開始,提取頁麵上的鏈接,然後訪問這些鏈接,再提取新鏈接。
理論上可行,但實際做起來問題很多。”
“什麼問題?”賈瀞雯問。
“比如,有些網站不允許被訪問。”說話的是王磊,團隊裡最年輕的一個,北大研究生在讀,“還有,網頁格式千奇百怪,怎麼準確提取鏈接?再比如,如果程序陷入死循環怎麼辦?”
賈瀞雯點點頭。
這些她也不懂,但她知道該問誰。
“今天先到這裡。”她看看表,“晚上我打電話問問陳總。
大家繼續研究其他部分,分詞算法那邊有進展嗎?”
張濤搖搖頭:“更難。
英文有空格分隔單詞,中文是連在一起的。
‘中華人民共和國’怎麼分?是‘中華’‘人民’‘共和國’,還是‘中華人民’‘共和國’?不同的分法,意思差彆很大。”
會議室裡一陣沉默。
五個年輕人你看看我,我看看你,都從對方眼裡看到同樣的困惑--這個項目,比他們想象的要難得多。
晚上八點,賈瀞雯在辦公室撥通了陳浩的電話。
“喂?”陳浩的聲音有點喘,背景裡有嘈雜的人聲。
“在忙?”
“剛下戲,換衣服呢。”陳浩走到安靜的地方,“說吧,今天遇到什麼問題了?”
賈瀞雯把白天的討論複述了一遍。
陳浩聽完,笑了:“正常,這些確實是難點。
你記一下,我一個個說。”
賈瀞雯拿起筆。
“第一,爬蟲的倫理問題。
我們要遵守robots協議,就是網站根目錄下的一個文本文件,告訴爬蟲哪些頁麵可以訪問,哪些不行。
這個必須遵守,不然我們會惹麻煩。”
“第二,網頁格式問題。
現在網頁主要是html,雖然各家寫法不一樣,但基本結構是固定的。
鏈接都在<ahref=>標簽裡,用正則表達式可以提取。”
賈瀞雯打斷:“正則表達式是什麼?”
“一種文本匹配的方法。”陳浩解釋,“比如你要找所有以‘’開頭的字符串。
這個讓技術人員去查資料,他們懂。”
“第三,防止死循環。
每個訪問過的鏈接都要記錄
(本章未完,請點擊下一頁繼續閱讀)