第13章空手套白狼
第13章空手套白狼(第2/3頁)
尼克從公開競賽題裡挑了一批結構清楚的題,按文檔要求整理候選程序,把其中一部分錯誤解法標上失敗原因,再用腳本生成針對性的反例探針。
一開始他還有點不耐煩,因為這東西過於手工。
指標漂亮當然是好事。
但前提是,漂亮的指標得是模型自發生成的。
而不是事先知道我要什麼樣的指標,故意設置甚至是手工修剪出來的指標。
為什麼未來華國的模型在測試表現上和阿美莉卡的模型差不多,但使用體驗卻有明顯差距。
就是因為針對測試的指標,進行的人工修剪成分過多了。
來自老板的文檔裡提前標註了:第一輪要證明失敗家族這個變量是否能提供額外信息。
如果這個變量在小規模手工標註裡都冇有價值,那就冇有必要專門寫程序把它給自動化。
第一天他跑完第一組基線,普通采樣加可見測試過濾後,候選程序在語法聚類上看起來很分散。
按照常規方法看,模型給出了不少不同方案。
一旦用反例探針重新測試,候選程序開始成片成片倒下。
變量名不同,循環結構不同,解法看起來不同,最後死在同一種邊界條件上。
尼克盯著結果,又跑了一遍。
結果差不多。
他開始興奮起來。
隱隱約約的感覺被程序給證實。
原本模糊的現象突然被測出來了。
團隊裡很多人都知道大規模采樣會製造虛假的多樣性,也知道候選程序之間存在同質化。
知道是一回事,能把它測出來是另一回事。
他接著按照文檔裡的方法訓練了一個很小的策略判彆器。
模型粗糙,數據不大。
它不能和alphacode相提並論,更談不上對外發布。
但在這批小樣本上,它已經能比語法聚類更穩定地把看起來不同、實則同源的候選程序歸到一起。
當他把反例生成器加入篩選流程後,最終留下的候選解法數量少了,策略互補性明顯變高。
他把結果導出成表格,又跑了三組不同隨機種子。
提升幅度有波動,趨勢冇有消失。
語法多樣性和策略多樣性之間的差距,被這個小實驗找到了命門。
哪怕已經到了深夜,尼克也忍不住要給巴布什金打個電話。
電話接通後,巴布什金冇有寒暄:“結果怎樣?”
尼克說:“結果很驚豔,我隱約覺得它找到了那條路,老板,你做到了!”
能從尼克語氣裡聽到興奮,顯然這個小的驗證效果好到出乎伊戈爾·巴布什金的預料。
他冇有回答,在思考。
尼克見電話那頭冇有回複,於是繼續說道:“在小規模驗證裡,這套東西確實測出了普通聚類測不到的策略坍縮。反例探針對候選程序的殺傷不是隨機的
(本章未完,請點擊下一頁繼續閱讀)