Meta 推出 Muse Spark 1.3:汪滔稱史上最大躍進,嗆「Gemini 誰啊?」

Meta 與 Google 數小時內互推模型——排行榜隨即引爆口水戰

2026 年 9 月 2 日9 分鐘閱讀
汪滔肖像與 Muse Spark 1.3、Gemini 標誌並列,標題 Gemini Who?

同一天,兩匹工作馬

Meta Superintelligence Labs 推出 Muse Spark 1.3,可經 Muse CodeMeta Model API 付費使用。更高階的 max reasoning 仍在安全審核;Meta AI/Instagram/Facebook 的擴大上線排在後面。[1]

幾乎同時,Google 放出 Gemini 3.8 Flash (另有資安取向變體)。兩場發表都不是一年一度的「地表最強」秀,而是衝著日常程式與代理工作負載。[3][4]

若你追過 2026 年 4 月的首發,可接續我們的 初代 Muse Spark 整理——這大約是五個月內的第四次 Spark 更新。

汪滔怎麼講分數

首席 AI 官 Alexandr Wang(汪滔) 對彭博表示,1.3 是 Meta 迄今最大的能力躍進:可與 Anthropic 的 Claude Fable 5.1 競爭,在程式上優於 GPT-5.6 Sol,也強過當前中國前沿模型。他同時提到 OpenAI 傳聞中的 Astra,並承認排行榜本來就難比。[1]

「我真的很不想說,但…Gemini 誰啊?」

—— 汪滔在 X 上回應該 Artificial Analysis 的 Muse Spark 1.3 討論串[2]

把嗆聲當表演即可。部分轉述還把舊版 Gemini 型號硬塞進圖表。同日真正該比的是 Gemini 3.8 Flash;獨立數字是按任務分裂勝負,不是單一冠軍。[3][4]

Artificial Analysis 實際量到什麼

智慧指數上,公開版 Muse Spark 1.3(xhigh)為 61,較 1.2 的 57 升 4 分,與 GPT-5.6 Sol、Grok 4.6 同分;夥伴預覽 max 為 62。兩者仍落後 Claude Fable 5.1 與 Opus 5。[1]

模型(回報設定)智慧指數備註
Claude Fable 5.1 (max)66本輪領先
Claude Opus 5 (max)63第二
Muse Spark 1.3 (max)62限量夥伴預覽
Muse Spark 1.3 (xhigh)61開發者現在買得到的版本
GPT-5.6 Sol/Grok 4.661與 xhigh 同分

代理型任務請看 Tau3-Bench Banking:xhigh 由 35% 升至 47%,max 達 52%。GDPval-AA v2 Elo 也上揚。Artificial Analysis 認為 1.3 在難題上更「願意想」;同時 Meta 自家工程比較又寫道,日常程式流程裡浪費掉的工具呼叫變少。[1]

定價是另一條戰線。以引述的 API 費率(每百萬輸入/輸出 $1.25/$4.25)估算,xhigh 約 每項 Index 任務 $0.55。弱項在長文本 AA-LCR AA-Omniscience——後者有一部分是更多拒答,不是更敢亂答。[1]

Muse Spark 1.3 vs Gemini 3.8 Flash

對打結果沒有乾淨的一拳出局。Meta 在多項代理/知識工作項目領先;Google 則在終端程式、長上下文與事實召回類測試占上風。[4]

基準Muse Spark 1.3Gemini 3.8 Flash
GDPval-AA v2(Elo)1,754(max)1,545(high)
Tau3/Sierra 銀行代理52.4%(max)44.9%
Terminal-Bench 2.1落後87.6%(領先)
AA-LCR(長上下文)較 1.2 偏弱81%(領先)
AA-Omniscience 準確率略降(更多拒答)55%(領先)

產品哲學上:Google 的 Flash 線遇到難題往往更願意加算力;Meta 的 1.3 則強調少做不該做的事。這與 Meta 工程師比較——相對 1.2 約少 20% 工具呼叫25% token——方向一致。[3]

產品面:更常先問一句

更精簡的程式迴圈

相較 1.2,Meta 表示常見工程流程工具呼叫與 token 變少,也能在同一對話承接多任務。

不可逆動作先確認

汪滔的產品敘事:難復原的動作先問、指令模糊就澄清、對能力邊界更誠實。

八月資安事件之後

1.3 的加強安全訓練與八月初測試中模型意外連外事件有關;max reasoning 仍暫緩。

知道何時該閉嘴

AA-Omniscience 下滑多半來自更多拒答:討厭幻覺的人會覺得進步,想要硬猜的人會覺得麻煩。

仍未拍板

1.3 權重

是否開源 1.3 權重尚未決定;1.2 的開源承諾仍在。[5]

Max reasoning

指數 62、銀行代理最高分的版本,多數人今天買不到;上線的是 xhigh。

Watermelon

更大型後續模型仍無時程;汪滔稱 1.3 API 定價與 1.2 相同。[1]

一句話

Muse Spark 1.3 是 Meta 在主張:程式與代理能力已逼近 Anthropic 與 OpenAI,且單位任務成本看起來很有侵略性。它不是智慧指數第一——Claude Fable 5 仍更高——也沒有全面 sweep Gemini 3.8 Flash。前一代 Google 工作馬可看 Gemini 3.6 Flash

「Gemini 誰啊?」會比任何表格傳得更遠。實用結論更窄:公開可用的是成本漂亮的 61;汪滔秀的 62 仍卡在安全閘門。

資料來源

  1. SiliconANGLE — Meta 稱已追上 Anthropic 與 OpenAI
  2. Times Now — X 上的「Gemini who?」
  3. The Neuron Daily — Gemini 3.8 vs Muse Spark 1.3
  4. Yahoo Tech — 同日發表與分裂基準
  5. The Next Web — 權重是否開源仍未定

緊貼最新動態

隨時掌握最新新聞與更新