DeepMind試行“雙盲”模型評測:AI排行榜開始防範測試題泄露
CoinMeta
08-31 13:15
Ai 焦點
大模型評測有一個越來越尷尬的問題:當基準題目在網上流傳、訓練團隊又能反複針對排行榜調整參數時,高分究竟代表模型能力,還是代表它更熟悉考題?Google DeepMind 在8月27日公佈了一項「雙盲」評測試點,試圖將模型開發方和評測題庫相互隔離。它借用了臨牀試驗中減少偏差的思路,但執行工具不是密封信封,而是經過密碼學保護的計算環境。
有幫助
No.幫助

大模型評測有一個越來越尷尬的問題:當基準題目在網上流傳、訓練團隊又能反複針對排行榜調整參數時,高分究竟代表模型能力,還是代表它更熟悉考題?Google DeepMind 在8月27日公佈了一項「雙盲」評測試點,試圖將模型開發方和評測題庫相互隔離。它借用了臨床試驗中減少偏差的思路,但執行工具不是密封信封,而是經過密碼學保護的計算環境。

這項工作由 William Isaac、Sol Messing 和 Kristian Lum 介紹。核心安排是:評測方不需要將私有測試集交給模型公司,模型公司也不必將尚未公開的模型權重和完整系統暴露給評測方。雙方在受控環境中完成計算,只獲得約定範圍內的結果。這個設計針對的是專有模型評估中最難處理的信任問題——既要防止試題提前進入訓練和優化流程,也要保護模型提供方的商業機密。

排行榜的可信度,正在被“看過答案”這一行為所消耗。

過去幾年,大模型排行榜承擔了太多任務。研究人員用它來判斷技術進展,企業採購則依此縮小候選範圍,普通用戶則將其視為產品優劣的簡明答案。但一旦某套測試成為行業標準,它就會迅速從「未知問題」變成訓練目標。這些測試題目可能出現在論文、代碼庫和討論區中,也有可能被整理進後續的訓練數據中。即便團隊沒有故意作弊,只要數據來源夠廣,模型見過類似內容的概率也會持續上升。

另一種偏差來自於反複試驗。開發者在了解評測規則後,可以更換提示詞、推理長度、採樣方式及工具設定,直到得到最好的分數。這樣得到的成績未必虛假,但已不再等同於模型面對真正未知任務時的表現。對於外部評測機構而言,完全隱藏測試集有助於保持新鮮度;對於模型公司而言,將權重交給第三方又可能帶來知識產權和安全風險。傳統做法往往迫使其中一方先讓步。

雙盲試點的價值就在於拆解這個二選一的難題。受保護的環境允許評測代碼在模型上運行,同時限制雙方接觸不應該看到的內容。結果可以按照事先約定的統計方式輸出,原始題目、模型細節和中間數據則保留在「邊界」之內。如果流程設計得當,模型團隊無法根據單一道題來反向優化,評測方也無法複製或探查模型。這比一份保密協議更具有可執行性,因為限制是由技術環境來落實的,而不是僅依賴參與者的自律。

但「世界首个雙盲 AI 評測」的說法不應被理解為評測難題已經解決。密碼學隔離能減少洩露,卻不能自動保證題目本身代表真實能力。一個偏狹、標註有誤或與用戶需求無關的測試集,即使完全保密,結論仍可能失真。系統還需明確誰來配置運行參數、如何處理工具調用、失敗樣本是否計入、結果能否複現,以及環境運營方是否擁有過大的管理權限。雙盲保護的是信息邊界,而非方法論的全部質量。

從一次試點走向行業規則,還需補上可複核性

這項試點首先適用於高價值、低頻率的尖端模型評估。例如安全能力、複雜推理或專業領域測試,一旦題庫洩露,重新設計的成本非常高。對於這些任務而言,將模型和測試集置於隔離環境中,可能比公開排行榜更有意義。採購方也可以委託獨立機構運行與自身業務相近的私有測試,而不必將敏感業務數據直接交給模型供應商。

問題是,評測越封閉,外界就越容易只接受一個最終分數。要建立公信力,流程需要公開足夠多的非敏感信息:測試涵蓋哪些能力、樣本如何抽取、評分誤差有多大、運行配置是什麼、是否存在人工複核,以及誰能審計環境。最好還有多家獨立機構使用相同協議來重現結果。否則,“測試集不能公開”可能從合理的防洩露措施,變成阻止質疑的擋箭牌。

成本和可用性也是現實的障礙。加密計算、受控執行和審計記錄會增加工程的複雜度,而前沿模型本身又需要大量的計算能力。每次模型更新都需重新運行整個流程,這並不適合迭代速度較快的小團隊。因此,雙盲評測更有可能先成為關鍵評估的高標準選項,而不是立即取代所有公開基準。公開測試仍有利於學術上的重現和快速比較,而私有的雙盲測試則負責檢驗模型面對未知任務的能力,兩者可以互相補充。

從更長期的角度來看,這次試點改變的是模型發布時的證明方式。過去公司發布新模型時,常使用一張自己選擇的排行榜來說明其優勢;未來,重要的能力可能需要通過隔離環境和獨立評測者的共同認可。對於行業而言,這將使得「我們測得的成績更高」逐漸轉變為「其他人也能按照預先約定的方法測得更高的成績」。雖然分數仍然不會等同於現實世界的表現,但至少可以減少那些「先看題目、再進行考試」的機會。

Bothata jwa mmatota jwa tshekatsheko ya AI e ne e se go tlhoka dintlha tsa tesimale, mme go na le moo e ne e le go tlhoka go tshepa gore diphetso di fitlheletswe jang. Lenaneo la teko la DeepMind le fana ka karolo ya setegeniki ya thadiso: ho dumella banka ya dipotso le mohlala ho kopana ntle le ho pepesana. Kgato e e latelang ke go bona gore a batsayakarolo ba ka dira gore melao ya go dira, mekgwa ya dipalopalo le maikarabelo a boruni e nne setheo. Ke gone fela "double-blind" e tla nnang se se fetang fela go nna letshwao le le utlwalang sentle; e tla nna lera le le netefadiwang la bosupi mo polelong ya bokgoni jwa sekao.

打賞
$0
點讚
0
收藏
0
瀏覽量 34
HQYC提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
web3 : SK 海力士獲標普上调評級,機構看高至240美元
AI芯片需求帶動SK海力士業績走強,標普上调其信用評級,多家機構將目標價上調至240美元。
CoinPedia
·2026-09-01 15:48:13
15
web3:俄羅斯加密交易新法生效,零售投資者可限額參與
俄羅斯加密交易新法9月1日生效,零售投資者可經測試後限額買入,跨境結算獲合法途徑。
Cryptonews
·2026-09-01 15:48:10
14
web3:外媒:美委石油协议或影响股市与加密市场
外媒稱,美委石油協議若壓低油價,或通過通貨膨脹與利率預期影響股市和加密市場,但短期效果存疑。
Watcher.Guru
·2026-09-01 15:24:07
14
web3 : Solana AMM 協議 Aquifer 遭攻擊損失250萬美元
Solana協議 Aquifer 遭攻擊損失約250萬美元,項目方提出返還80%資產可保留20%獎金的白帽方案。
Cryptonews
·2026-09-01 15:24:04
15
美國航空加入特朗普賬戶配套計劃
美國航空加入特朗普賬戶企業配套計劃,為符合條件的員工子女追加1000美元,相關賬戶已吸引逾650萬家庭報名。
Coinpaper
·2026-09-01 15:10:58
16
查看更多