第4章你來自哪?
第4章你來自哪?(第3/4頁)
編程競賽裡,隱藏測試是不可見的。你怎麼避免隻是發明出一套帶有自己偏差的基準測試?”
這次light_chen冇有馬上回複。
過了大約五分鐘,他發來一段更長的回答。
“我們隻需要用一組根據題目描述和候選程序行為生成的探針。
對每個候選程序,提取它隱含的假設,然後生成小規模的對抗性探針族,專門攻擊這些假設。
在最終過濾之前,估計候選解的多樣性是否真實存在。如果80%的候選程序都死在同一類探針族上,那麼就可以順利掩蓋一個已經坍縮的策略空間。”
伊戈爾開始認真起來。
他回複:“假設我們接受這個觀點。那麼指標應該長什麼樣?原始聚類數量?失敗家族上的熵?還是彆的什麼?”
“我會定義三個數字。
原始采樣數:生成了多少個程序。
行為幸存數:有多少程序通過了可見測試或樣例測試。
語義有效樣本量:在自適應探針下,還剩下多少個不同的失敗吸引域。
有用的比率增加語義有效樣本量/原始采樣數和語義有效樣本量/行為幸存數。
如果第一個比率很小,說明模型采樣到的隻是風格。
如果第二個比率很小,說明過濾器選出來的隻是同一個想法的不同變體。
如果兩個比率都會隨著規模提高而提高,那麼模型確實在學習真正的策略多樣性。”
伊戈爾靠在椅背上,仔細一想,臥槽大佬啊,對方給的策略有點可行性。
他看出價值了,冇有再繼續在推特上繼續和對方聊天,而是選擇切換到推特私信裡。
先給light_chen點了個關註,然後接著問道:“你認為這是代碼生成特有的問題,還是語言模型的一般性限製?”
“一般性限製,但代碼把它暴露出來。”
“在語言裡,表麵多樣性甚至更具有欺騙性。十個答案看起來可以完全不同,卻共享同一個隱藏框架。”
“代碼有用,是因為失敗可以被運行給判斷出來。”
“如果我們能做到如何在代碼裡測量坍縮的策略空間,就能得到一種更廣泛診斷推理係統的方法。”
伊戈爾想了想,問了個有點尖銳的問題:“如果冇有alphacode的內部訪問權限,你怎麼測試這一點?”
他想看看對方能不能在冇有alphacode的內部權限的情況下設計出近似驗證方法。
過了一會兒,light_chen回複:
“使用演示題目裡的公開樣例足夠做一次合理性檢查。”
“選擇那些演示中展示了多個生成解法或解釋的題目。”
“手動重構解法家族。”
“圍繞可能的不變量生成對抗性變體。”
“比較這些不同的解法是否會一起
(本章未完,請點擊下一頁繼續閱讀)