第一百三十章虛擬與現實
第一百三十章虛擬與現實(第2/4頁)
們產線上最熟練的工人。”蘇酥雪說。
“超過工人是意料之中的事。”陸迪峰說,“我關心的是另一件事——它在麵對從未遇到過的情況時,是怎麼處理的?”
蘇酥雪切換到了第三段回放畫麵。這次的場景是一個模擬的故障排除任務——一條虛擬產線的某個關鍵工位突然卡死,棋手模型需要診斷故障原因並采取修複措施。這個任務在訓練中冇有出現過類似的先例,屬於完全的未知情境。
畫麵中,棋手模型在產線卡死後停頓了大約兩秒鐘——這是它在分析和評估情況的時間。然後它做出了一係列動作:首先,它控製虛擬探頭檢查了卡死工位的傳感器讀數;然後,它調用了書庫中關於該型號設備的結構圖紙,進行了快速的比對分析;最後,它推斷出卡死的可能原因是傳動皮帶脫落,並控製虛擬工具將皮帶複位。整個診斷和修複過程耗時約四十五秒,相當於一個經驗豐富的維修工人的平均用時。
“它從來冇有見過這個故障模式。”蘇酥雪說,“但它通過組合已有的知識——傳感器數據分析、結構圖紙理解、工具操作技能——成功地解決了這個從未遇到過的問題。這就是我們想要的‘泛化能力’。”
“不好的方麵呢?”陸迪峰問。
蘇酥雪關掉了回放畫麵,調出了一份數據報表。報表上用紅色標註了幾條曲線,曲線的走勢在某個時間點之後出現了明顯的偏離。
“棋手模型在訓練後期,出現了一些我們稱之為‘策略固化’的現象。”蘇酥雪的語調比剛才低沉了一些,“在麵對某些特定類型的任務時,它會傾向於使用它最熟悉、最擅長的策略,即使存在更優的策略可選。”
(本章未完,請點擊下一頁繼續閱讀)第一百三十章虛擬與現實(第2/2頁)
她點開了一個具體的案例。在傳送帶分揀任務中,棋手模型幾乎總是優先抓取距離最近的物體,而不是按照物體的優先級順序來安排抓取順序。這種“就近優先”策略在大多數情況下是高效的,但在某些特殊情況下——例如當遠處有一個高優先級物體即將通過傳送帶末端、而近處有幾個低優先級物體時——這種策略會導致高優先級物體被漏撿。
“我們測試了多種不同的物體排列組合,發現在大約百分之七的情況下,‘就近優先’策略不是最優選擇。但棋手模型很少主動選擇其他策略,即使在訓練中我們多次向它展示了更優策略的存在。”
“這是為什麼?”
“目前的分析結論是:棋手模型在訓練過程中,對‘成功率’的優化權重過高,對‘效率’的優化權重相對不足。‘就近優先’策略的成功率很高——百分之九十三——雖然它不是最優的,但它的
(本章未完,請點擊下一頁繼續閱讀)