法师归来,速通地球!

第10章忽悠傻了

加入书签 推荐本书

第10章忽悠傻了(第2/3页)

节约时间。

我觉得这是非常具备可行性的方案,给他一点机会未尝不可。

你也说过,大部分时候求稳,但当机会出现的时候,该赌就得赌。”

赵立明被气笑了:“我是让你该赌的时候就赌,但你看看他背景,唯一有可信度的背景是来自伊戈尔·巴布什金的背书,还只是远程聊过。

他没有去硅谷,没有在deepmind工作,也没有在推特工作。

背书力度太弱了,你明白吗?

另外,你以为用gpt的数据来训练是什么很了不起的方案,是什么天才的灵光一闪。

那是因为你了解的太少,你没有从事这一行,你在江城科技大学学的是四十年前的数据结构和c语言。

你没有关注开源社区的前沿动态。

华盛顿大学和艾伦人工智能研究所在chatgpt发布的第一时间就发表了论文,论文名字叫self-instruct。

你所谓的用gpt数据训练只是一句话,人家已经写成论文,并且进行了实验。

self-instruct的核心内容就是让大模型自己生成自己的训练数据。

他们把方法都公布了,一个迭代的过程。

先准备一小批人工写的指令,这些作为例子来引导模型生成新任务。

用当前模型提示它生成新的、更多样的指令。

比如给它几个种子例子,让它发明新任务。

为每个新指令生成输入和输出。

对生成的指令,再让模型生成对应的input和 output。

这样就得到一条完整的instruction、input和output三元组。

过滤低质量数据,用启发式规则自动过滤无效的任务、与已有任务重复度太高的、输出质量差的。

把过滤后的高质量数据加回任务池,可以继续迭代生成更多数据。

最后用这些合成数据对原始基座模型进行监督微调。

你以为的灵光一闪,人家早就想到了并且实践落地了。

你以为自己发现了天才,殊不知人家可能只是比你懂得多一点呢!

你以为他有知识,可能他只是有知道呢?”

(ps:上述是yizhong wang在2022年12月20日挂在arxiv上的论文,论文全称:self-instruct: aligning language models with self-generated instructions,也是蒸馏方法的开创者。

其中艾伦人工智能研究院是由微软联合创始人保罗·艾伦于2014年创立的一家专注于人工智能前沿研究的机构。)

在江城大学湖滨七舍被室友们吹上天的陈神,在江城富人区的别墅里,在赵立明

(本章未完,请点击下一页继续阅读)

上一页 章节目录 下一页

小说推荐:恐怖复苏:离婚后,我不替她挡灾了骇夜:我在恐怖游戏里暴富丧尸专列龙珠:超级签到系统欲衔蝉公路求生:开局觉醒修罗序列洪荒:开局加入万界美女聊天群激荡年代,我为祖国守边疆重生98,我在基层当民警近战狂兵叶军浪苏红袖我仙门弟子,身边都是妖女魔女恋冬日出之后(综漫同人)本丸种田物语