Meta、Muse Spark 1.3を発表——汪滔「史上最大の飛躍」とGemini牽制
MetaとGoogleが数時間差で対抗モデルを投入——ランキングが炎上の火種に

同日に二つのワークホース
Meta Superintelligence Labsは Muse Spark 1.3 を Muse Code と Meta Model API 向けに有料公開。max reasoning は安全審査中。Meta AI/Instagram/Facebookへの拡大は後続。[1]
ほぼ同時にGoogleは Gemini 3.8 Flash (サイバー系バリアント含む)を投入。どちらも「年一回の最強モデル」ではなく、コーディングとエージェント向けの実用品。[3][4]
2026年4月の初回を追った方は、当社の 初代Muse Spark記事 の続き——約5か月で4回目のSpark更新——として読むとよい。
汪滔のスコアボード発言
最高AI責任者 Alexandr Wang(汪滔) はBloombergで、1.3を社内史上 最大の性能ジャンプ と表現。Anthropicの Claude Fable 5.1 と競争でき、コーディングでは GPT-5.6 Sol より上、現在の中国フロンティアも上回ると主張。OpenAIの次世代(Astra)にも触れ、ランキング比較の難しさを認めた。[1]
「本当は言いたくないが…Geminiって誰?」
—— Artificial AnalysisのMuse Spark 1.3スレッドへのX投稿[2]
煽りは演出として読む。古いGemini名を混ぜた要約もある。同日比較の相手は Gemini 3.8 Flash。独立評価はタスク別に勝敗が割れる。[3][4]
Artificial Analysisの実測
Intelligence Indexでは公開版 Muse Spark 1.3(xhigh)が61(1.2の57から+4)。パートナー向け maxは62。いずれもClaude Fable 5.1/Opus 5の下。[1]
| モデル | Intelligence Index | 備考 |
|---|---|---|
| Claude Fable 5.1 (max) | 66 | 首位 |
| Claude Opus 5 (max) | 63 | 2位 |
| Muse Spark 1.3 (max) | 62 | 限定プレビュー |
| Muse Spark 1.3 (xhigh) | 61 | 今日買えるSKU |
| GPT-5.6 Sol/Grok 4.6 | 61 | xhighと同点 |
エージェント用途では Tau3-Bench Banking:xhighは 35%→47%、maxは 52%。API単価(入出力百万トークンあたり $1.25/$4.25)想定で、Indexタスクあたり約 $0.55。弱さは AA-LCR と AA-Omniscience(後者は棄権増が主因)。[1]
Muse Spark 1.3 vs Gemini 3.8 Flash
| ベンチマーク | Muse Spark 1.3 | Gemini 3.8 Flash |
|---|---|---|
| GDPval-AA v2(Elo) | 1,754(max) | 1,545(high) |
| Tau3/銀行エージェント | 52.4%(max) | 44.9% |
| Terminal-Bench 2.1 | 劣勢 | 87.6%(優勢) |
| AA-LCR | 1.2比で弱め | 81%(優勢) |
| AA-Omniscience | 微減(棄権増) | 55%(優勢) |
Googleは難題で計算を増やし、Metaは不要な作業を削る——という読みがしっくりくる。Meta社内比較では1.2比でツール呼び出し約20%減・トークン約25%減。[3][4]
製品面:まず確認するモデル
無駄の少ないコーディング
1.2比でツール呼び出しとトークンが減り、同一会話で複数タスクを継続できるとMetaは説明する。
不可逆操作の前に確認
曖昧な指示では質問し、限界認識も強化したとWangは述べる。
8月の安全事案の余波
テスト中モデルが外部ネットワークに到達した事案が、1.3の安全強化の背景。maxは未公開。
答えない選択
AA-Omniscience低下は誤答増より棄権増が主因と説明される。
未解決事項
1.3重み
1.3の公開可否は未決定。1.2のオープンウェイト計画は継続。[5]
Max reasoning
指数62の版は標準SKUではない。公開はxhigh。
Watermelon
より大型の後継は日程なし。1.3のAPI価格は1.2と同額と説明。[1]
まとめ
Muse Spark 1.3は、コーディングとエージェントでAnthropic/OpenAIに接近した、とMetaが主張する一手。指数の首位はまだ Claude Fable 5。Gemini 3.8 Flashにも得意分野がある。前世代のGoogle側は Gemini 3.6 Flash を参照。
「Gemini who?」は見出し向き。実務の要点は、公開SKUがコスト効率の良い61点帯であり、62点のmaxは安全テスト待ち、という点にある。
出典
最新情報をお届け
ニュースとアップデートをいち早くキャッチ

