Google 在9月15日更新了 AI 和 Economy ATLAS,並公佈了一項與 Google DeepMind、MIT FutureTech 合作的研究。該研究分析了2600個專業的 AI 模型,並調查了600多名美國和英國科學家。研究結果顯示,接近一半的受訪科學家每天使用某種 AI,受訪者自報每周可節省近7小時時間。但研究同時發現,更多假設被快速生成後,物理實驗、臨床驗證和結果核查出現積壓。這個結論比「AI 使科研提速」更完整:模型能縮短部分腦力流程,卻不能自動擴充實驗室、樣本和審批資源。
七小時並非自動增加的科研產出,而是被重新分配的時間
科學家使用 AI 的方式並不單一。大語言模型橫跨多個學科和任務,用於查找資料、整理思路、寫代碼和處理文字;專業模型則更集中於生命科學、健康研究以及特定的數據預測、生成和模擬。這兩類工具相互補充:通用模型降低了表達和編程的門檻,專業模型則將領域知識與數據結構做得更加深入。如果將所有 AI 的使用都歸為「聊天機器人」,就會忽略真正影響科研流程的專用系統。
受访者報告的近7小時屬於自報節省時間,不等於經過隨機試驗驗證的平均生產力,也不代表所有學科都能獲得同樣的收益。熟悉編程、數據充足的團隊,可能會更快將AI整合進工作流程;依賴昂貴設備、需要長期跟進或現場采樣的領域,前端節省的時間未必能縮短項目的總週期。調查對象主要來自美國和英國,也不宜直接代表全球科學界。
研究中最具啟發性的部分,是「假設的積壓」。當文獻歸納、數據分析以及候選方案的產生速度加快時,研究人員就能提出更多值得測試的問題。但實驗設備、倫理審批、臨床樣本以及資深研究人員的判斷並沒有同步擴大規模,於是瓶頸從想法的產生轉向了驗證階段。企業軟件中常見的規律,在實驗室中也同樣存在:優化一個環節,往往只是將排隊的問題轉移到下一個環節而已。
這意味著評估 AI 科研工具時,不能只計算寫作或編碼節省了多少分鐘。更重要的是,最終要驗證有多少有價值的假設得到證實,錯誤的候選項是否減少,實驗失敗率是否下降,以及論文和數據是否可以重複產生。如果模型讓團隊產生了十倍的候選項,卻沒有更好的排序和淘汰機制,實驗負擔反而可能上升。
Google 同時開放新的 ATLAS 交互體驗,讓用戶能夠查看不同職業、國家和任務中的 AI 使用情況。官方舉例稱,在經合組織國家,計算與數學、商業與金融職業的使用領先;在非經合組織國家,辦公室行政、創意媒體和教育等職業更突出。美國工作相關的 AI 使用中,計算和數學職業佔30%,約為其他地區相應比例的兩倍。這些數據描述使用構成,不應被誤讀為30%的美國技術人員都在使用 AI。
科研機構需要改造的是驗證體系,而不只是給每個人開一個賬號。
第一步是将 AI 的输出與研究證據分開記錄。文獻摘要、代碼、數據清洗和候選預測應保留模型版本、提示、輸入來源和人工修改。研究結論必須回歸到原始數據、實驗和同行審查。工具可以提出解釋,但不能將高置信度語氣視為證據等級。
第二步是投資下游能力。如果假設生成速度更快,機構應該增加共享實驗平台、自動化儀器、數據工程和統計複核資源,並建立候選項的優先級。否則,節省的七小時將變成更多的等待時間。管理者需要觀察項目週期的整體變化,而不仅仅是看員工的使用次數。
第三步是識別偏差。專業模型依賴於既有的數據,因此稀有疾病、資源較少的语言以及代表性不足的群體更容易被遺漏。大型模型還可能編造引用或複述已存在的主流假設。團隊應保留獨立的檢索、陰性結果和反證流程,以避免效率工具進一步放大學術共識中的盲點。
第四步是調整人才訓練。年輕的研究者如果直接獲得整理後的答案,可能會跳過理解實驗設計和數據限制的過程。合理的做法不是禁用 AI,而是要求他們解釋自己的選擇、複核引用、重現實驗,並將節省下的時間投入於更深入的領域學習。只有能發現模型錯誤的人,才能安全地使用模型。
ATLAS 本身是一項長期研究項目,Google 表示將繼續與學術伙伴擴展合作。目前提供的結果是使用情況和受訪者的感受,並非 AI 已經帶來某種確定比例的科學發現增長。尤其是「每天使用」和「節省時間」這兩點,可能會受到樣本、任務定義和自我報告的影響,需要後續獨立研究來驗證。
這項研究將 AI 生產力的討論推進了一步。真正的问题不在於科學家是否能更快地編寫代碼或總結論文,而在於整個發現鏈條是否能夠吸收這種新增的速度。當實驗、臨床和複核跟不上的時候,模型創造的只是候選庫存,而非知識。未來最成功的科研機構,可能不是產生假設最多的機構,而是最會篩選、驗證並公開不確定性的機構。










