第108章意外的物理学经验
第108章意外的物理学经验(第2/4页)
结构,每一处关节,都清晰可见。
他只花了不到半个小时,就将论文中所有的数学部分,全部吃透,甚至还能举一反三地,思考出几种可能的改进方向。
【整个大语言模型,从数学上看,可以被视为一个极其高维的丶非线性的函数逼近器。它的训练过程,就是在数十亿甚至数千亿个参数构成的空间中,通过梯度下降,寻找一个能最小化『损失函数』的最优解。而『注意力机制』,则为这个庞大的函数,提供了高效的『剪枝』策略,使其能够专注于处理长距离的依赖关系。】
然而,当他看到论文的后半部分,关于「神经网络架构」和「模型训练」的内容时,他的眉头,却渐渐地,锁了起来。
「transformer架构」丶「多头注意力」丶「残差连接」丶「层归一化」……
这些属于计算机科学和人工智慧领域的专业术语,对他而言,就如同一个个陌生的路标,指向一片他从未踏足过的未知领域。
如果不了解神经网络为什麽能拟合任何函数(万能逼近定理),对后续的深层神经网络乃至于transformer架构就更加不知道具体的工作机制了。
【对于ai,确实还存在着巨大的『盲区』。】
他没有气馁,反而燃起了一股强烈的求知欲。
他打开电脑,开始在网上,疯狂地,搜索着关于「大语言模型」的基础知识。
从最基础的「感知机」模型,到「深度神经网络」,再到「循环神经网络(rnn)」和「长短期记忆网络(lstm)」,最后,才是当今大模型的核心——「transformer」。
就在他将一篇关于「transformer」核心架构的经典论文——《attentionisallyouneed》,看到一半时。
他脑海中,那冰冷的系统提示音,毫无徵兆地,响了起来!
【叮!检测到宿主正在学习『人工神经网络』相关知识,认知边界拓展……】
【信息学经验值+2!】
【物理学经验值+1!】
【生化学经验值+1!】
「嗯?!」
徐辰的动作,猛地一顿!
他有些难以置信地,调出了自己的系统面板。
信息学经验值+2,很好理解,因为ai就是通过计算机来实现的,计算机相关的知识自然属于信息学的范畴。
但是,在「物理学」和「生化学」那两条几乎还是空白的经验条后面,都出现了一个小小的「+1」!
【什麽情况?!】
【我明明是在学计算机和ai,怎麽会加了物理和生化的经验?!】
【系统,你是不是出bug了?】
他先是一愣,随即,陷入了沉思。
【生化学经验+1,这个
(本章未完,请点击下一页继续阅读)