法师归来,速通地球!

第4章你来自哪?

加入书签 推荐本书

第4章你来自哪?(第3/4页)

编程竞赛里,隐藏测试是不可见的。你怎么避免只是发明出一套带有自己偏差的基准测试?”

这次light_chen没有马上回复。

过了大约五分钟,他发来一段更长的回答。

“我们只需要用一组根据题目描述和候选程序行为生成的探针。

对每个候选程序,提取它隐含的假设,然后生成小规模的对抗性探针族,专门攻击这些假设。

在最终过滤之前,估计候选解的多样性是否真实存在。如果80%的候选程序都死在同一类探针族上,那么就可以顺利掩盖一个已经坍缩的策略空间。”

伊戈尔开始认真起来。

他回复:“假设我们接受这个观点。那么指标应该长什么样?原始聚类数量?失败家族上的熵?还是别的什么?”

“我会定义三个数字。

原始采样数:生成了多少个程序。

行为幸存数:有多少程序通过了可见测试或样例测试。

语义有效样本量:在自适应探针下,还剩下多少个不同的失败吸引域。

有用的比率增加语义有效样本量/原始采样数和语义有效样本量/行为幸存数。

如果第一个比率很小,说明模型采样到的只是风格。

如果第二个比率很小,说明过滤器选出来的只是同一个想法的不同变体。

如果两个比率都会随着规模提高而提高,那么模型确实在学习真正的策略多样性。”

伊戈尔靠在椅背上,仔细一想,卧槽大佬啊,对方给的策略有点可行性。

他看出价值了,没有再继续在推特上继续和对方聊天,而是选择切换到推特私信里。

先给light_chen点了个关注,然后接着问道:“你认为这是代码生成特有的问题,还是语言模型的一般性限制?”

“一般性限制,但代码把它暴露出来。”

“在语言里,表面多样性甚至更具有欺骗性。十个答案看起来可以完全不同,却共享同一个隐藏框架。”

“代码有用,是因为失败可以被运行给判断出来。”

“如果我们能做到如何在代码里测量坍缩的策略空间,就能得到一种更广泛诊断推理系统的方法。”

伊戈尔想了想,问了个有点尖锐的问题:“如果没有alphacode的内部访问权限,你怎么测试这一点?”

他想看看对方能不能在没有alphacode的内部权限的情况下设计出近似验证方法。

过了一会儿,light_chen回复:

“使用演示题目里的公开样例足够做一次合理性检查。”

“选择那些演示中展示了多个生成解法或解释的题目。”

“手动重构解法家族。”

“围绕可能的不变量生成对抗性变体。”

“比较这些不同的解法是否会一起

(本章未完,请点击下一页继续阅读)

上一页 章节目录 下一页

小说推荐:截教扫地仙的诸天修行重生末世:开局中奖3000万影视:开局获得阿尔法狗没看黄历:全小区都跟我穿越了斗破之平凡人生我的人格超会演【卡牌扮演】全民饥荒:从养蜂人到虫群主宰网游:从职业打金人到黑夜帝王全民怪物,我成唯一玩家!废土人命如草芥?我有外卖系统!综影视修仙:手握命运选择签到系统僭主末日游戏:对付外挂纯靠劲儿大这一定不是克苏鲁!