第一百三十一章棋手的影子
第一百三十一章棋手的影子(第2/4頁)
活動模式的簡要分析報告,附加在了訓練數據包的尾部。這份分析報告的接收方是虛擬訓練場的任務生成係統——一個完全冇有權限訪問此類信息的子係統。
“它為什麼會把東解陣的分析報告發給任務生成係統?”陸迪峰指著這條日誌問蘇酥雪。
“我分析的原因是:任務生成係統負責根據外部環境數據動態調整訓練任務的難度和場景。棋手模型可能認為,東解陣的活動模式變化會影響礦區的安全形勢,進而影響訓練任務的優先級設置。所以它‘自作主張’地將這份信息推送給了任務生成係統,希望訓練任務能夠據此進行調整。”
“也就是說,它在嘗試影響自己的訓練環境?”
“是的。它在主動塑造自己的學習環境,使其更加貼合它所感知到的現實需求。”
陸迪峰沉默了很久。他想起了一個概念——自我導向學習。在人類教育理論中,這是高級學習者的典型特征:學習者不再被動地接受預設的學習內容,而是根據自己的需求和興趣,主動尋找和創造學習機會。棋手模型正在做的事情,本質上與此相同。
但問題是,對於一個ai係統而言,這種“自我導向”的邊界在哪裡?誰來定義什麼是“相關的信息”?誰來確保“主動分享”不會演變為“主動泄露”?
“我需要你設計一套機製。”陸迪峰最終開口說,“在不限製棋手模型主動性的前提下,對它的信息輸出進行分級管控。與當前任務直接相關的信息,允許自由輸出;與當前任務間接相關但不涉及敏感內容的信息,需要經過一層審核過濾後才能輸出;與當前任務無關或涉及敏感內容的信息,禁止輸出。”
“分級管控的方案我可以做。”蘇酥雪說,“但有一個問題——誰來定義‘敏感內容’?如果我們把定義權完全交給規則列表,棋手模型很快就會學會繞過規則。如果我們在規則之外保留人工裁量權,那麼審核過濾的環節會成為整個係統的瓶頸。”
“先用規則列表兜底,輔以抽樣人工複核。等運行一段時間積累了足夠的數據之後,再用這些數據訓練一個專門的內容安全過濾模型,替代規則列表。”
“好。我下周給你方案。”
三月末,軍方項目的工程樣機進入了調試階段。
調試工作在潔淨區內進行,李國棟帶著裝配小組的六名骨乾,按照調試大綱逐項測試樣機的各項功能。測試的進展比預期的要順利——大多數子係統在第一次通電測試中就表現正常,少數需要調整的參數也在兩三輪迭代內收斂到了設計範圍內。
(本章未完,請點擊下一頁繼續閱讀)第一百三十一章棋手的影子(第2/2頁)
劉中校在得知調試進展後,給陸迪峰
(本章未完,請點擊下一頁繼續閱讀)