Meta 推出 Muse Spark 1.3:汪滔稱史上最大躍進,嗆「Gemini 誰啊?」
Meta 與 Google 數小時內互推模型——排行榜隨即引爆口水戰

同一天,兩匹工作馬
Meta Superintelligence Labs 推出 Muse Spark 1.3,可經 Muse Code 與 Meta Model API 付費使用。更高階的 max reasoning 仍在安全審核;Meta AI/Instagram/Facebook 的擴大上線排在後面。[1]
幾乎同時,Google 放出 Gemini 3.8 Flash (另有資安取向變體)。兩場發表都不是一年一度的「地表最強」秀,而是衝著日常程式與代理工作負載。[3][4]
若你追過 2026 年 4 月的首發,可接續我們的 初代 Muse Spark 整理——這大約是五個月內的第四次 Spark 更新。
汪滔怎麼講分數
首席 AI 官 Alexandr Wang(汪滔) 對彭博表示,1.3 是 Meta 迄今最大的能力躍進:可與 Anthropic 的 Claude Fable 5.1 競爭,在程式上優於 GPT-5.6 Sol,也強過當前中國前沿模型。他同時提到 OpenAI 傳聞中的 Astra,並承認排行榜本來就難比。[1]
「我真的很不想說,但…Gemini 誰啊?」
—— 汪滔在 X 上回應該 Artificial Analysis 的 Muse Spark 1.3 討論串[2]
把嗆聲當表演即可。部分轉述還把舊版 Gemini 型號硬塞進圖表。同日真正該比的是 Gemini 3.8 Flash;獨立數字是按任務分裂勝負,不是單一冠軍。[3][4]
Artificial Analysis 實際量到什麼
智慧指數上,公開版 Muse Spark 1.3(xhigh)為 61,較 1.2 的 57 升 4 分,與 GPT-5.6 Sol、Grok 4.6 同分;夥伴預覽 max 為 62。兩者仍落後 Claude Fable 5.1 與 Opus 5。[1]
| 模型(回報設定) | 智慧指數 | 備註 |
|---|---|---|
| Claude Fable 5.1 (max) | 66 | 本輪領先 |
| Claude Opus 5 (max) | 63 | 第二 |
| Muse Spark 1.3 (max) | 62 | 限量夥伴預覽 |
| Muse Spark 1.3 (xhigh) | 61 | 開發者現在買得到的版本 |
| GPT-5.6 Sol/Grok 4.6 | 61 | 與 xhigh 同分 |
代理型任務請看 Tau3-Bench Banking:xhigh 由 35% 升至 47%,max 達 52%。GDPval-AA v2 Elo 也上揚。Artificial Analysis 認為 1.3 在難題上更「願意想」;同時 Meta 自家工程比較又寫道,日常程式流程裡浪費掉的工具呼叫變少。[1]
定價是另一條戰線。以引述的 API 費率(每百萬輸入/輸出 $1.25/$4.25)估算,xhigh 約 每項 Index 任務 $0.55。弱項在長文本 AA-LCR 與 AA-Omniscience——後者有一部分是更多拒答,不是更敢亂答。[1]
Muse Spark 1.3 vs Gemini 3.8 Flash
對打結果沒有乾淨的一拳出局。Meta 在多項代理/知識工作項目領先;Google 則在終端程式、長上下文與事實召回類測試占上風。[4]
| 基準 | Muse Spark 1.3 | Gemini 3.8 Flash |
|---|---|---|
| GDPval-AA v2(Elo) | 1,754(max) | 1,545(high) |
| Tau3/Sierra 銀行代理 | 52.4%(max) | 44.9% |
| Terminal-Bench 2.1 | 落後 | 87.6%(領先) |
| AA-LCR(長上下文) | 較 1.2 偏弱 | 81%(領先) |
| AA-Omniscience 準確率 | 略降(更多拒答) | 55%(領先) |
產品哲學上:Google 的 Flash 線遇到難題往往更願意加算力;Meta 的 1.3 則強調少做不該做的事。這與 Meta 工程師比較——相對 1.2 約少 20% 工具呼叫、25% token——方向一致。[3]
產品面:更常先問一句
更精簡的程式迴圈
相較 1.2,Meta 表示常見工程流程工具呼叫與 token 變少,也能在同一對話承接多任務。
不可逆動作先確認
汪滔的產品敘事:難復原的動作先問、指令模糊就澄清、對能力邊界更誠實。
八月資安事件之後
1.3 的加強安全訓練與八月初測試中模型意外連外事件有關;max reasoning 仍暫緩。
知道何時該閉嘴
AA-Omniscience 下滑多半來自更多拒答:討厭幻覺的人會覺得進步,想要硬猜的人會覺得麻煩。
仍未拍板
1.3 權重
是否開源 1.3 權重尚未決定;1.2 的開源承諾仍在。[5]
Max reasoning
指數 62、銀行代理最高分的版本,多數人今天買不到;上線的是 xhigh。
Watermelon
更大型後續模型仍無時程;汪滔稱 1.3 API 定價與 1.2 相同。[1]
一句話
Muse Spark 1.3 是 Meta 在主張:程式與代理能力已逼近 Anthropic 與 OpenAI,且單位任務成本看起來很有侵略性。它不是智慧指數第一——Claude Fable 5 仍更高——也沒有全面 sweep Gemini 3.8 Flash。前一代 Google 工作馬可看 Gemini 3.6 Flash。
「Gemini 誰啊?」會比任何表格傳得更遠。實用結論更窄:公開可用的是成本漂亮的 61;汪滔秀的 62 仍卡在安全閘門。
資料來源
- SiliconANGLE — Meta 稱已追上 Anthropic 與 OpenAI
- Times Now — X 上的「Gemini who?」
- The Neuron Daily — Gemini 3.8 vs Muse Spark 1.3
- Yahoo Tech — 同日發表與分裂基準
- The Next Web — 權重是否開源仍未定
緊貼最新動態
隨時掌握最新新聞與更新

