第133章符號邏輯推理的數學模型
第133章符號邏輯推理的數學模型(第2/4頁)
的非線性函數逼近器。」
「所謂的訓練,就是在這個高維空間裡,尋找一個能讓損失函數最小化的點。」
「所謂的泛化,就是希望這個函數在冇見過的數據點上,也能表現得足夠好。」
徐辰一邊看,一邊在心裡默默總結。
在他眼中,那些複雜的網絡結構圖,瞬間被還原成了最本質的數學公式。
……
然而,當他試圖深入了解最新的大語言模型(llm)時,卻發現了一個尷尬的問題。
書,不夠看了。
ai領域的發展速度,實在是太快了。
傳統的學術界,知識的沉澱和出版,往往需要幾年的時間。一本教材從編寫到出版,可能裡麵的技術就已經過時了。
而ai,尤其是大模型,幾乎是以「周」為單位在疊代。
這種「工業界倒逼學術界」的現象,在ai領域尤為明顯。
很多最前沿的技術,根本來不及寫進書裡,甚至來不及發表正式的論文,就已經被openai丶google丶meta這些科技巨頭,直接應用到了產品中,或者以技術博客丶開原始碼的形式,扔到了github和huggingface上。
「看來,光看書是不行了。」
徐辰果斷調整了策略。
他打開了coursera丶udemy,以及b站,找到了幾門由史丹福大學丶吳恩達丶李飛飛等頂級大佬開設的最新網課。
《cs224n:自然語言處理與深度學習》
《cs231n:卷積神經網絡與視覺識彆》
《生成式ai導論》
他開啟了倍速播放,一邊看,一邊在腦海中構建著知識圖譜。
徐辰學得飛快。
這得益於他那恐怖的數學底子。
……
在ai領域,有一條不成文的鄙視鏈:搞算法的看不起搞調參的,搞理論的看不起搞應用的。
而站在鄙視鏈頂端的,永遠是那些數學功底深厚的人。
普通的ai工程師,可能隻會調用pytorch或tensorflow的api,像搭積木一樣搭建模型,然後對著一堆超參數進行「玄學」調優。他們知道「怎麽做」,但往往不知道「為什麽」。
而數學家,看到的則是更本質的東西。
他們看到的是流形上的概率分布,是高維空間中的幾何結構,是優化算法的收斂性證明。
「ai人員的數學好,通常是指他們擅長線性代數丶概率論和微積分,能看懂公式,能推導梯度。」
「但數學家的數學好,是指他們能洞察這些公式背後的『結構』與『本質』。」
……
五天後。
當徐辰關掉最後一節關於「transformer架構源碼解析」的網課視頻時,他長長地舒了一口氣。
海量的知識,從最底
(本章未完,請點擊下一頁繼續閱讀)