🤖 AI

AI25|AI 第一次學會說「我不確定」,Claude Opus 4.8 把可靠性推到新高

AI25|AI 第一次學會說「我不確定」,Claude Opus 4.8 把可靠性推到新高

Anthropic 在同一天內丟出三顆炸彈:核心產品升級、650 億美元投資、米蘭新辦公室,估值逼近兆元俱樂部。其中最值得細看的是 Claude Opus 4.8——它不只是版本號的跳升,而是 Anthropic 在 AI 大戰裡押注了一個與眾不同的方向:讓 AI 學會示弱、學會說「我不確定」,反而讓人更敢用它。

哪種同事最嚇人?平常很沉默、出手就是三連炸的那種

你有沒有遇過這種同事——平日不聲不響,然後某天在會議上連丟三顆炸彈,每一件單獨拿出來都是別家公司一整年的頭條?這個禮拜,Anthropic 就做了這件事。一天之內:核心模型升級、談下 650 億美元投資、米蘭開設新辦公室,估值直接衝破 9650 億美元,幾乎踩進兆元俱樂部的門檻。

這集 Podcast 我選擇深挖其中最關鍵的那一條——Claude Opus 4.8。因為它不只是「又一個版本迭代」,它代表 Anthropic 在這場 AI 軍備競賽裡,押注了一個和所有競爭對手都不一樣的方向。

這次升級,Anthropic 具體做了三件事

  • AI 開始學會說「我不確定」: 這聽起來很普通,但在實際測試數據上,意義非常大。無批判轉述錯誤結果的比例降到 0%,過度自信的比例比上一代降了將近十倍。這代表 Claude Opus 4.8 在面對不確定的問題時,不會硬撐著給你一個聽起來流暢但可能是錯的答案——它會告訴你它不確定。這是業界目前從來沒見過的誠實度水準。
  • 同時指揮上千個小幫手的動態工作流: Opus 4.8 可以在執行任務時,一次協調大量的子任務同時進行,這些子任務不只是分工,還能互相辯論、交叉驗證。這讓 AI 從「一對一助理」升級成「能調度整個團隊的專案經理」,對複雜任務的處理能力是質的跳躍。
  • 強度旋鈕與計費邏輯的改變: 你現在可以調整 AI 投入多少算力在這個任務上,計費方式也從「對話次數」改成「算力消耗」。這個改變看起來是商業模式的調整,但背後的意義是:你終於可以根據任務的重要程度,決定要讓 AI 用多大的力氣來處理它。

「示弱」為什麼反而是這次最重要的突破?

我在這集節目裡花了最多時間討論的,是第一點——誠實度的提升。過去我們用 AI 工具最大的焦慮之一,就是不知道它什麼時候在唬爛。它的語氣永遠自信,排版永遠整齊,但你沒辦法分辨它是真的知道,還是只是在「很有把握地猜測」。

這種特性在低風險的創意任務裡還好,但只要你開始把 AI 用在需要準確資訊的場景——研究、法律、醫療、財務——你就會開始不自覺地替它做事後查核,反而多了一層工作。

Opus 4.8 如果真的把「我不確定」這件事做到位,它改變的不只是模型的準確率,而是人和 AI 之間的信任結構。你開始可以相信:它說確定的時候,大概率是確定的;它說不確定的時候,你就知道要自己去查。這才是真正能嵌入工作流的 AI。

對不同身分的人,這次升級意味著什麼?

在節目裡我用三種身分來拆解這次升級的實際影響:

  • 寫文字的人: 誠實度提升代表你在用 AI 做資料整理或背景調查時,可以更快辨認哪些段落需要人工複查,而不是每一句話都要自己去 Google 一遍。
  • 寫程式的人: 多智能體的動態工作流對開發者來說是很直接的升級——複雜的 debug 任務、多步驟的程式生成,現在可以拆分給不同的子任務平行處理,效率會有感提升。
  • 做企業 IT 或導入 AI 的人: 計費邏輯的改變讓你在規劃成本時有更細緻的控制空間,不同優先程度的任務可以分配不同強度的算力,這對大規模部署來說是很實際的彈性。

AI 學會示弱,我反而更敢用它了

這集節目錄完之後,我自己最大的感受就是這句話:AI 第一次真正學會示弱,這個示弱反而讓我更敢把它放進真正重要的工作裡。一個永遠自信的助手,你沒辦法完全信任它;一個知道自己極限在哪裡的助手,才值得你認真依賴。

Anthropic 這次的押注方向,我認為是對的。如果你想聽更完整的分析與細節,這集 Podcast 都有,歡迎去聽完整版。


📚 同主題的其他單集 / 文章,延伸聽下去:

🎙 這篇文章延伸自 Podcast《操作一下》。想用聽的,完整一集在這裡:

🎙 喜歡這篇?訂閱電子報
新單集延伸文章上線就寄給你。不發廣告、不賣課,隨時退訂。
← 在操作一下看完整體驗 →