第348章饑不擇食的META
第348章饑不擇食的META(第2/7頁)
替換全自註意力,避免問題和段落序列的交叉計算。
這允許獨立處理輸入文本,實現段落表示的預計算,從而大幅減少運行時計算。
deformer結構與transformer相似,可直接用預訓練權重初始化,並在qa數據集上微調。
我們的實驗顯示,deformer版本的bert和xlnet在qa任務上加速4.3倍以上,僅通過簡單蒸餾損失損失1%準確率。”
尼蘭詹說的是他2020年在acl會議上發表的論文,是當時llm優化領域的經典工作,當時llm流行的模型叫bert,這篇論文直接構建在預訓練transformer上,llm的瓶頸,也就是計算成本,在下遊任務中凸顯,這篇則一定程度上提出了解決思路。
“包括我在2020年的另外一篇工作,其實和llm的核心,也就是多層註意力有著類似的核心邏輯”
尼蘭詹自然不是水貨,他在人工智能領域確實浸淫多年,有不錯的成果,手上有好幾篇頂會文章,都和llm有關。
那還是2020年,當時大模型還名不見經傳呢,在人工智能領域屬於邊緣化的方向。
紮克伯格是花了很多冤枉錢,把臉書改名meta錯誤估計了元宇宙的到來時間,但不代表他冇腦子,單純因為尼蘭詹是林燃的教授,就找他來。
尼蘭詹自己真有幾把刷子,也是很重要的原因。
大模型裡的關鍵工作,包括自註意力機製、多頭註意力、位置編碼這些,尼蘭詹都有深入的研究,畢竟他研究的重要方向之一就是nlp。
紮克伯格欣喜過望,覺得自己找對人了。
“巴拉蘇布拉馬尼安教授,在訓練llm中,你是如何處理過擬合或者欠擬合問題呢?”
“大規模訓練,預訓練涉及在海量無標簽數據上學習通用表示,我們可以通過掩碼語言建模或下一句預測;另外微調在特定任務數據集上調整權重,實現遷移學習。
針對過擬合,我認為使用正則化和dropout,比如說在bert變體中dropout率0.1,並應用早停機製;欠擬合時,增加模型深度或數據增強。
在之前的項目中,我通過梯度裁剪處理訓練不穩定,在glue基準上將過擬合率從15%降至5%,這能幫助大模型訓練在多任務適應中更高效。”尼蘭詹成竹在胸。
問這個,對我而言不是小意思?
紮克伯格後續又問了一些關於參數高效微調、多模態模型主要挑戰、幻覺成因及緩解策略等問題,尼蘭詹對答如流。
紮克伯格聽完之後,確定自己找對人了。
對方被關在監獄一年多時間,出來還能侃侃而談,追上最新進度,一眼就是
(本章未完,請點擊下一頁繼續閱讀)