Claude Opus 5.5上线:價格降了四成,Anthropic 更想證明“長期任務不會跑偏”
CoinMeta
Ai 焦點
Anthropic 在9月22日發布了 Claude Opus 5.5,這是 Claude 5.5系列的首個模型。公司給出的核心賣點非常直觀:在多數工作上達到了 Claude Fable 5.1的水準,與上一代 Opus 5相比,運行成本降低了40%。但這次發布真正值得關注的,不僅是價格和排行榜,而是 Anthropic 將測試重點進一步推向了長時間任務、難以逆轉的操作,以及提示注入防護功能。
有幫助
No.幫助

Anthropic 在9月22日發布了 Claude Opus 5.5,這是 Claude 5.5系列的首個模型。公司給出的核心賣點非常直觀:在多數工作上達到了 Claude Fable 5.1的水準,與上一代 Opus 5相比,運行成本降低了40%。但這次發布真正值得關注的,不僅是價格和排行榜,而是 Anthropic 將測試重點進一步推向長時間任務、難以逆轉的操作,以及提示注入防護功能。

官方稱,Opus 5.5在複雜編碼、研究和專業知識工作上有了明顯提升。早期測試者中,有團隊在不到一天的時間內使用它完成了約68萬行代碼的遷移;Anthropic也強調該模型能夠保持更長的上下文和計劃連續性。案例能說明能力上限,但不能被當作所有項目的平均交付時間。代碼庫結構、測試覆蓋率和人工審查都會影響最終結果。

降本不等於「便宜版旗艦」,而是重新劃分模型使用邊界

過去,Opus 通常被留給最複雜、最昂貴的任務,日常工作的處理則多交給速度更快的型號。如果 Opus 5.5 真的能以較低的成本接近 Fable 5.1 的水準,企業就有可能將這款旗艦型號用於更大規模的代碼審查、文檔分析及研究流程中,而不只是在少數高價值的請求上使用它。

成本下降40%是Anthropic相對於Opus的官方說法,並不代表每家企業的費用都會同步下降40%。實際費用取決於輸入輸出長度、緩存、工具調用次數以及任務是否需要重試。更強大的模型也可能因為被賦予更長的任務而消耗更多的總Token。采購方需要用自己的工作負載來測試「完成一項任務的總成本」,而不是只比較單價。

長期任務的能力同樣需要以完成品質來衡量。一次大規模的代碼遷移可能會產生大量看起來合理的改動,但真正的成本包括回歸測試、依賴性衝突、部署和回滾等。如果模型需要工程師花上數天時間來修復邊緣問題,那麼速度上的優勢就會縮水。最有價值的評估應該同時記錄成功率、人工接管的次數以及不可逆的錯誤,而不仅仅是記錄產生了多少代碼。

Anthropic 表示 Opus 已經接受了 Frontier Design、METR 等外部評估者的發布前測試。外部參與能夠提高可信度,但並不代表所有報告、原始數據和測試環境都已經完全公開。用戶仍應該區分公司自報的結果、獨立評估的結果以及自己在自己的環境中復現的結果。

安全測試開始關注真實事故形態,而不只是短问答的拒答率

Anthropic 表示,Opus 5.5 在其自動化行為審計中取得了公司目前最好的成績。測試覆蓋了數千個模擬情境,重點包括模型是否會採取難以撤銷的動作、是否會越過用戶給定的邊界,以及在面對提示注入時是否能保持原任務。公司還將不可能完成的任務、持續時間更長的任務和基於真實事故設計的場景加入評估之中。

這是代理型 AI 进入生產環境後必須補上的一課。傳統的安全測試常會檢查模型是否會回答某些類型的敏感問題,但能夠瀏覽網頁、調用終端和修改文件的代理,其風險更多來自於行動鏈:它可能會在錯誤的假設下繼續執行,也有可能將網頁中的惡意文字當成指令。一次錯誤的點擊或權限的擴大,比一段不當的回答更難挽回。

「越界情況越少」並不等於「絕對不會越界」。Anthropic 明確承認模型存在限制。企業在進行部署時,仍需採用最小權限原則、操作確認、可追蹤的日誌記錄、沙箱環境以及回滾機制。尤其是在處理生產數據庫、支付系統和基礎設施的變更時,不應因為模型的安全分數提升就取消人工審批流程。

這也是 Anthropic 提出「放慢前沿節奏」之後的首個模型發布。公司試圖傳達的訊息是:繼續提升能力,同時將外部評估和更接近真實事故的安全測試納入發布流程。不過,判斷這一承諾能否成立,需要看後續是否持續披露失敗案例、測試方法及修復效果,而不是一次發布中的最高分數。

對用戶而言,Opus 5.5最值得測試的並非聊天回答是否更「漂亮」,而是它能否在數小時、多工具、多步驟的任務中保持穩定性,以及在資訊不足時能夠及時停止。模型市場的競爭正從「誰回答得更有智慧」轉向「誰能以可控制的成本完成複雜的工作」。價格的下降讓更多人有機會嘗試,而安全與工程紀律則決定這些嘗試是否能真正投入生產環境。

企業在試用時可以建立一組簡單但嚴格的對照:使用同一批真實任務來比較 Opus 5、Opus 5.5 和較低成本的模型,記錄完成時間、總費用、測試通過率、人工修改量以及高風險動作次數。只有這些指標同時改善,升級才具有商業意義。發布日的演示適合發現可能性,連續數週的內部評測才適合決定權限和預算。

打賞
$0
點讚
0
收藏
0
瀏覽量 39
HQYC提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
Binance向Circle投資1億美元:五年合作瞄準USDC增量,不等於穩定幣格局已經改寫
Circle與Binance於9月22日宣布擴大合作:Binance對Circle進行1億美元的戰略股權投資,雙方簽署新的五年商業協議,重點在於新興市場的推廣、整合及擴大USDC的使用。Circle將提供持有及使用USDC所需的基礎設施服務,而Binance則計劃在其平臺內加強USDC的曝光度及產品接入。
币界网
·2026-09-23 09:56:08
232
Coinbase協助打掉EvilTokens:釣魚工具開始用AI挑選「最值得騙的人」
Coinbase 在9月22日披露,與執法和安全合作伙伴合作打擊了一個名為 EvilTokens 的釣魚即服務平台。該平台通過 Telegram 机器人出售整套攻擊能力,包括郵箱收集、偵查、網頁郵箱界面以及 AI 自動化功能。運營者還計劃將攻擊範圍擴大到 Gmail 和 Okta 賬戶。此事件的危險之處不在於又出現了一套仿冒登錄頁面,而在於攻擊者將入侵郵箱後的關係分析和付款目標篩選工作交給了 AI。
币界网
·2026-09-23 09:54:52
230
加拿大7月跨境旅行继续分化:美国游客与海外游客,恢复节奏并不一样
加拿大統計局9月22日發布7月跨境旅行數據:加拿大居民從海外返回385.99萬人次,同比增長6.9%;非居民訪客入境458.46萬人次,同比增長7.9%。經季節調整後,加拿大居民返回368.38萬人次,環比下降0.3%;非居民入境262.83萬人次,環比增長1.2%。暑期通常是全年高峯,因此同比和季調環比必須分開看。
币百科
·2026-09-23 09:53:50
41
英國8月借款183億英鎊:單月高於預測,債務率下降卻不等於負擔變輕
英國8月公共部門淨借款達183億英鎊,比去年同期增加29億英鎊,增幅19%,也高於預算責任辦公室預測的35億英鎊。英國國家統計局9月22日公布的数据同時顯示,4月至8月的財政年度累計借款為773億英鎊,比去年同期少22億英鎊,卻仍高於官方預測的81億英鎊。
币百科
·2026-09-23 09:52:50
36
Google 用32種非洲語言進行語音挑戰:AI 能聽懂嗎?Lingala 和 Shona,難點遠不止於數據不足
Google Research 在9月22日公布了 WAXAL 语音识别挑战的结果。WAXAL 是一套涵盖32種非洲語言的開源語音數據,該比賽由 Google 與數據科學社區 Zindi 合作舉辦,參賽者首先圍繞 Lingala 和 Shona 构建自動語音識別系統。該項目旨在解決一個長期被忽視的問題:數百萬人日常主要使用當地口語,但主流語音 AI 通常聽不懂他們的說話。
CoinMeta
·2026-09-23 09:51:39
39
查看更多