科技入侵現代

第348章饑不擇食的META

加入書簽 推薦本書

第348章饑不擇食的META(第2/7頁)

替換全自註意力,避免問題和段落序列的交叉計算。

這允許獨立處理輸入文本,實現段落表示的預計算,從而大幅減少運行時計算。

deformer結構與transformer相似,可直接用預訓練權重初始化,並在qa數據集上微調。

我們的實驗顯示,deformer版本的bert和xlnet在qa任務上加速4.3倍以上,僅通過簡單蒸餾損失損失1%準確率。”

尼蘭詹說的是他2020年在acl會議上發表的論文,是當時llm優化領域的經典工作,當時llm流行的模型叫bert,這篇論文直接構建在預訓練transformer上,llm的瓶頸,也就是計算成本,在下遊任務中凸顯,這篇則一定程度上提出了解決思路。

“包括我在2020年的另外一篇工作,其實和llm的核心,也就是多層註意力有著類似的核心邏輯”

尼蘭詹自然不是水貨,他在人工智能領域確實浸淫多年,有不錯的成果,手上有好幾篇頂會文章,都和llm有關。

那還是2020年,當時大模型還名不見經傳呢,在人工智能領域屬於邊緣化的方向。

紮克伯格是花了很多冤枉錢,把臉書改名meta錯誤估計了元宇宙的到來時間,但不代表他冇腦子,單純因為尼蘭詹是林燃的教授,就找他來。

尼蘭詹自己真有幾把刷子,也是很重要的原因。

大模型裡的關鍵工作,包括自註意力機製、多頭註意力、位置編碼這些,尼蘭詹都有深入的研究,畢竟他研究的重要方向之一就是nlp。

紮克伯格欣喜過望,覺得自己找對人了。

“巴拉蘇布拉馬尼安教授,在訓練llm中,你是如何處理過擬合或者欠擬合問題呢?”

“大規模訓練,預訓練涉及在海量無標簽數據上學習通用表示,我們可以通過掩碼語言建模或下一句預測;另外微調在特定任務數據集上調整權重,實現遷移學習。

針對過擬合,我認為使用正則化和dropout,比如說在bert變體中dropout率0.1,並應用早停機製;欠擬合時,增加模型深度或數據增強。

在之前的項目中,我通過梯度裁剪處理訓練不穩定,在glue基準上將過擬合率從15%降至5%,這能幫助大模型訓練在多任務適應中更高效。”尼蘭詹成竹在胸。

問這個,對我而言不是小意思?

紮克伯格後續又問了一些關於參數高效微調、多模態模型主要挑戰、幻覺成因及緩解策略等問題,尼蘭詹對答如流。

紮克伯格聽完之後,確定自己找對人了。

對方被關在監獄一年多時間,出來還能侃侃而談,追上最新進度,一眼就是

(本章未完,請點擊下一頁繼續閱讀)

上一頁 章節目錄 下一頁

小說推薦:末日:隨身帶著一套房假太監:我乃大明九千歲大博學者的二次元木葉:宇智波華麗的叛逆冰河末世,我囤積了百億物資死神:我五大貴族,不玩數值!重生天龍,大宋小王爺,天下無敵重生2013:超級科技帝國星辰之主這就是牌佬的世界嗎?亞達賊!全民遊戲:從喪屍末日開始掛機殺一怪疊一毒,從新手村開始無敵成為路明非的白月光神寵供應商