第135章邏輯與生成的結合
第135章邏輯與生成的結合(第2/4頁)
的模塊——邏輯門控單元。
「gumbel-box的平滑性,是為了在訓練階段讓梯度能夠流淌,讓模型能『學會』邏輯。但在推理階段,也就是真正上考場的時候,這個平滑的邊界必須瞬間『硬化』。」
他在草稿紙上畫了一個陡峭的sigmoid函數。
「我設定一個邏輯置信度閾值t(第十九個希臘字母,念做「套」)。當兩個概念在幾何空間裡的重疊體積低於這個閾值時,說明它們在邏輯上幾乎不相容,比如『貓』和『植物』。」
「這時候,門控單元會像一把閘刀一樣落下,直接將這個路徑的概率強行截斷為0!」
「傳統的llm是『我覺得應該這麽說』,而加了門控的laart是『雖然我想這麽說,但幾何邏輯告訴我,這麽說是錯的,所以我閉嘴』。」
「這才是完美的邏輯與生成的結合。」
解決了這個關鍵的機製問題,徐辰終於滿意地點了點頭。
……
搞定了數學模型的優化,擺在徐辰麵前的,是另一個棘手的工程問題。
benchmark(業內普遍直接用英語稱呼,意思是基準測試)怎麽選?
做ai研究,光有模型冇用,你得拉出來溜溜。你得在公開的測試中,把以前的模型,比如transformer丶bert丶gpt等給考倒了,彆人才承認你牛逼。
當年的transformer為了證明它比以前的rnn和lstm強,google團隊選擇了「英德機器翻譯數據集」。
這是一個非常經典的任務。評價標準是bleu分數,也就是看機器翻譯出來的句子,和人類翻譯的句子,在詞彙重疊度上有多高。
transformer在那場考試中,以28.4的bleu分數,刷新了世界紀錄,從此一戰成名。
「但是。我的模型優勢不在於『翻譯』,也不在於『文本生成』的流暢度。」
現在的gpt模型,靠著海量的語料堆砌,已經是天生的語言大師了。讓laart去跟它們比誰寫詩寫得好,誰翻譯得溜,那是拿自己的短處去碰彆人的長處。
laart的核心優勢是什麽?
是邏輯。
是永遠不會說「貓是植物」,永遠不會在做三段論推理時出現「a>b,b>c,所以a<c」這種弱智錯誤的嚴謹性。
「用翻譯數據集測邏輯,就像是考愛因斯坦背單詞,根本測不出智商。」
「我需要一套專門考『邏輯推理』的卷子。」
他在arxiv和github上飛速檢索。
很快,幾個備選方案浮現在眼前。
1.snli(stanfordnaturallanguageinference):斯坦福自然語言
(本章未完,請點擊下一頁繼續閱讀)