第1741章彆被技術細節嚇住
第1741章彆被技術細節嚇住(第2/3頁)
下來,下次遇到就直接跳過。
還要設置深度限製,不能無限爬下去。”
賈瀞雯飛快地記著。
陳浩的聲音很平靜,好像這些難題都不是問題。
“那中文分詞呢?”她問,“這個他們覺得特彆難。”
電話那頭沉默了一會兒。
“這個確實難。”陳浩承認,“英文搜索可以直接按單詞匹配,中文必須先把句子切分成有意義的詞語。
我們需要的不是機械切分,而是理解語義後的智能切分。”
“怎麼做?”
“兩種思路。”陳浩說,“一是基於詞典,把常用的詞做成詞典庫,然後匹配。
二是基於統計,分析大量文本,找出經常連在一起出現的字組合。
(本章未完,請點擊下一頁繼續閱讀)第1741章彆被技術細節嚇住(第2/2頁)
最好的辦法是兩者結合。”
賈瀞雯記下最後幾個字,筆尖頓了頓:“浩哥,這些概念你怎麼都懂?你又冇學過計算機。”
陳浩笑了:“我是不懂具體編程,但我懂邏輯,懂原理。
而且我看得多,想得多。
搜索引擎的核心不是技術多炫,而是理解人想要什麼,然後從數據裡找出來。”
他頓了頓:“瀞雯,你告訴團隊,彆被技術細節嚇住。
我們不是在寫完美的學術論文,是在做一個能用的工具。
第一版可以粗糙,可以有問題,但要快,要讓用戶能用上。
改進可以慢慢來。”
掛斷電話後,賈瀞雯把筆記整理成文檔,打印了五份。
第二天開會,她把陳浩的話轉述給團隊。
“陳總說,第一版可以粗糙,但要快。”她看著五張年輕的臉,“我們不求完美,但求可用。”
李明眼睛一亮:“這就對了。
我們總想一次做到最好,結果越想越不敢動手。
其實可以先做個最簡單的版本,能跑起來就行。”
“對!”張濤一拍桌子,“爬蟲可以先從幾個固定的網站開始,比如新聞網站。
這些網站結構規範,容易抓取。
分詞可以先做基於詞典的簡單版本,複雜的以後再說。”
團隊的氣氛活躍起來。
年輕人就是這樣,不怕困難,就怕迷茫。
一旦有了方向,哪怕方向不完美,他們也敢往前衝。
三天後,新的問題來了。
這次是王磊提出的。
他在研究分詞算法時,遇到了一個具體難題。
“賈總,我們試了基於詞典的方法,但遇到一個問題。”王磊在白板上寫了個例子,“比如‘乒乓球拍賣完了’這句話。
怎麼分?”
他畫出兩種分法:“‘乒乓球/拍賣/完了’,這是說乒乓球被拍賣掉了。
但也可以是‘乒乓/球拍/賣完了’,這是說球拍賣光了。
同一個句子,兩種分法,意思完
(本章未完,請點擊下一頁繼續閱讀)