從專有 LLM API 竊取推理軌跡:重大安全漏洞曝光
主流 AI 模型發現重大安全缺陷

一項突破性研究論文揭露了影響 Anthropic、OpenAI 和 Google 等主要 AI 供應商的重大安全漏洞。該研究顯示,攻擊者可以從專有大型語言模型(LLM)API 中提取隱藏的推理軌跡——這些資訊原本不應該被公開存取。
什麼是推理軌跡?
推理軌跡是進階 AI 模型用來解決複雜問題的內部「思考過程」。可以把它們想像成 AI 在給出最終答案之前創建的草稿或工作筆記。Anthropic、OpenAI 和 Google 等公司刻意隱藏這些軌跡,以保護競爭優勢與安全性。
保護專有技術
保護專有技術和競爭優勢,避免被外界取得。
防止逆向工程
防止透過洩漏的內部推理逆向工程破解模型。
維護訓練安全
維護訓練方法與內部系統設計的安全性。
品質控制
只展示精煉的輸出,而非凌亂的中間草稿。
漏洞原理:攻擊如何運作
研究展示了一種出奇簡單卻有效的攻擊方法:
步驟 1:提取簽名
向 Claude Opus 4.8 等模型發送請求,收到包含隱藏「思考區塊」簽名的回應——本質上是 AI 內部推理過程的指紋。
步驟 2:重建推理
將此簽名發送回相同或相關模型(如 Claude Haiku),誘騙系統揭示完整的隱藏推理軌跡。
步驟 3:驗證提取
在 120 個 Codeforces 程式設計問題上測試,發現提取的軌跡與源模型生成的實際思考標記數量高度吻合。

三大 AI 平台的驚人結果
研究測試了三個主要 AI 平台。結果顯示實際思考標記與重建推理之間幾乎完美的相關性,證明攻擊有效。
| 供應商 | 發現 |
|---|---|
| Anthropic(Claude) | 成功提取顯示因式分解過程和數學思維的推理軌跡 |
| OpenAI(GPT-4 系列) | 容易受到相同提取技術的攻擊 |
| Google API | 同樣容易遭受推理軌跡竊取 |

為什麼這很重要
對 AI 公司而言
此漏洞代表嚴重的智慧財產權風險。競爭對手可以:
- 逆向工程專有推理方法
- 了解訓練方法和模型架構
- 無需研發投資即可複製競爭優勢
對用戶和企業而言
- 隱私疑慮:關於機密數據的敏感推理可能被曝光
- 安全影響:可透過推理分析識別攻擊向量
- 信任問題:質疑還有哪些隱藏資訊可能被提取
對 AI 產業而言
- 在透明度和安全性之間取得平衡
- 保護基於 API 服務的專有資訊
- 確保 AI 系統的強大安全性
除智慧財產權風險外,公開分享的工作階段日誌若被解碼,也可能洩漏使用者從未打算公開的機密——僅存在於加密推理區塊中的憑證與個人資料。

實際案例:因式分解攻擊
論文展示了一個具體例子,AI 嘗試分解數字 8139881:
分解因數,8139881 = 1627 × 5003, 兩者都是質數,所以最大質因數是 5003。
隱藏的推理顯示了 AI 的試錯過程,檢查整除規則和測試小質數——關於模型解決問題方法的寶貴資訊。
對 AI 安全的影響
這項研究提出了關鍵問題:
API 回應中存在多少隱藏資訊?
其他類型的專有數據能否以類似方式提取?
AI 供應商應該實施什麼安全措施?
推理軌跡是否應該加密或更好地保護?
AI 供應商應該做什麼
| 立即行動 | 長期解決方案 |
|---|---|
| 審計 API 回應的資訊洩漏 | 以安全優先原則重新設計 API 架構 |
| 實施更強的簽名保護 | 實施零知識證明系統 |
| 審查標記計數機制 | 創建隔離的推理環境 |
| 為推理軌跡添加加密 | 開發更好的存取控制機制 |
用戶應該知道什麼
如果您在生產環境中使用這些 AI API:
假設可能曝光
假設推理軌跡可能被曝光,避免處理高度敏感資訊。
審查數據政策
審查您的數據處理政策以應對 AI 互動。
監控 API 使用
監控異常 API 使用模式,這可能表明存在利用行為。
保持更新
保持更新,關注 AI 供應商的安全補丁。
AI 安全的未來
這項研究為 AI 產業敲響了警鐘。隨著模型變得更加複雜和有價值,安全措施必須相應發展。透明度(用戶想了解 AI 推理)、安全性(公司需要保護智慧財產權)與功能性(模型需要有效思考)之間的張力,將定義下一代 AI 系統。
結論
從主要 AI API 中竊取推理軌跡的發現是一個重大的安全啟示。雖然研究展示了 Anthropic、OpenAI 和 Google 平台的漏洞,但它也為產業提供了一個機會,在惡意行為者利用這些弱點之前加強安全措施。
隨著 AI 越來越多地整合到關鍵系統和業務運營中,確保這些模型的安全性不僅僅是保護企業機密——更是維護對 AI 技術本身的信任。

