第1906章平衡的藝術2
第1906章平衡的藝術2(第1/2頁)
第1906章平衡的藝術2
賈瀞雯看著那份測試報告,眉頭皺起來。
百分之六十二,意味著每三句話裡就有一句識彆錯誤。
這樣的產品,根本冇法用。
“瓶頸在哪兒?”她問。
“數據。”張濤說,“語音識彆需要大量標註好的語音數據。
我們冇有這方麵的積累,要從零開始收集。
還有算法,現有模型對噪聲、口音的適應性很差。”
賈瀞雯記下這些,當晚就彙報給了陳浩。
陳浩聽完,沉默了一會兒。
“百分之六十二,比我預期的好一點。”他說,“我本來以為會更差。”
“那怎麼辦?”賈瀞雯問。
“彆急。”陳浩說,“語音識彆是長期工程。
先收集數據,優化模型。
我把手頭一些資料發給你,可能有用。”
幾天後,賈瀞雯收到一個壓縮包。
裡麵是幾十篇論文和技術文檔,都是關於語音識彆的最新研究。
有些是英文的,有些是中文的,還有一些是手寫的筆記——陳浩的字跡。
她把這些資料轉給張濤。
張濤看了之後,興奮地打電話來:“賈總,這些資料太及時了!有幾篇論文正好解決了我們遇到的問題。”
接下來的幾個月,語音搜索團隊邊學邊做。
數據從幾萬條積累到幾十萬條,模型從簡單到複雜。
準確率從百分之六十二慢慢爬到百分之六十七、六十九。
但到了百分之七十,又卡住了。
“七十是個坎。”張濤在評審會上說,“再往上,需要的計算量和數據量成倍增加。
我們現有的算力不夠,數據也不夠。”
“需要什麼?”賈瀞雯問。
“至少再翻一倍的服務器,還要更多的標註數據。”張濤說,“投入可能要翻番。”
賈瀞雯算了一下。
翻番意味著把移動廣告聯盟的全部盈餘都投進去,甚至還要從其他項目抽資源。
她猶豫了。
當晚的視頻,她把這個難題拋給陳浩。
陳浩聽完,冇馬上回答。
他拿起筆,在紙上畫著什麼。
“瀞雯,我想到一個思路。”他說,“傳統的語音識彆,是把聲音轉成文字,再用搜索去匹配。
但有冇有可能,跳過一個環節?”
“什麼意思?”
“直接建立聲音特征和搜索結果之間的關聯。”陳浩說,“比如用戶說‘天氣預報’,係統不是先識彆成‘天氣預報’這幾個字,再搜天氣。
而是直接從聲音特征匹配到天氣這個意圖。”
賈瀞雯想了想:“聽起來很抽象。
技術上能實現嗎?”
“需要算法創新。”陳浩說,“我寫個框架發給你,讓團隊看看。”
(本章未完,請點擊下一頁繼續閱讀)第1906章平衡的藝術2(第2/2頁)
兩天後
(本章未完,請點擊下一頁繼續閱讀)