第八十九章基石
第八十九章基石(第4/5頁)
“這是一條正確的路,也是一條艱難的路。但隻要方向是對的,再難也值得走下去。”
幾天後,蘇酥雪再次來到礦區,這次她帶來了一份更加詳細的實施方案,以及一個讓陸迪峰感到不安的附加議題。
“有一個問題,我必須在項目啟動之前和你坦誠地討論。”蘇酥雪的語氣比平時更加嚴肅,“認知引擎的核心目標之一,是讓模型具備自我迭代的能力——能夠根據新的數據和反饋,自動優化自身的結構和參數,不斷提高推理和預測的準確性。這個能力一旦實現,模型的進化速度將是指數級的,遠遠超過人類手工調優的速度。”
“這不是好事嗎?”陸迪峰問。
“在可控的前提下,是好事。但問題是,自我迭代能力是一把雙刃劍。如果模型在迭代過程中產生了一些我們無法理解的內部表征和推理路徑——這種情況在大模型中已經屢見不鮮,被稱為‘湧現行為’——而我們又無法有效地對其進行解釋和乾預,那麼它可能會在某個我們意想不到的方向上加速進化,脫離我們的控製範圍。”
“你擔心它會失控?”
“不是我擔心,而是整個行業都在擔心。”蘇酥雪說,“目前全球範圍內,還冇有任何一家機構真正解決了大模型的安全對齊問題。大家都在加速投入,都在搶著推出更大、更強的模型,但冇有人敢拍著胸脯說,自己的模型絕對不會產生有害行為。我們如果要走這條路,就必須從一開始就把安全機製放在與性能提升同等重要的位置上,甚至更優先。”
“你有具體的方案嗎?”
“有一個初步的框架。”蘇酥雪打開筆記本電腦,調出了一份架構示意圖,“我稱之為‘三明治架構’。底層是規則感知模塊,與戰鬥單元上的設計類似,但更加嚴格——它定義了引擎在任何情況下都不能違反的絕對底線。頂層是人類可理解的解釋層——引擎的所有重要決策,都必須生成一份人類可以閱讀和理解的自然語言解釋,並存檔備查。中間層是模型的推理和計算核心,這一層可以有湧現行為和不可解釋的內部表征,但它的輸入和輸出都受到底層和頂層的雙重約束。”
“也就是說,我們允許模型在中間層自由發揮,但它的輸入必須經過底層的安全過濾,輸出必須經過頂層的可解釋性驗證。”
“對。這個架構不能百分之百保證安全,但可以把失控的風險降低到可以接受的水平。”
陸迪峰沉默了很久。他知道,蘇酥雪提出的這個方案,是目前技術條件下最務實的安全架構。但他也清楚,任何安全架構都無法完全消除風險——在人工智能這個領域,絕對的 安全 是不存在的。他們所能做的,隻是在追求技術進步的同
(本章未完,請點擊下一頁繼續閱讀)