Colibri:わずか25GBのRAMで7440億パラメータモデルを動かす革命的AIエンジン

ColibriがAI分野で特別な理由
Colibri(コリブリ)は、JustVuggによって開発された画期的なオープンソースAI推論エンジンで、一見不可能に思える目標を実現しています。7440億パラメータの巨大なMixture-of-Experts(MoE)モデルであるGLM-5.2を、わずか約25GBのRAMを備えた民生用ハードウェア上で動作させるのです。この「小さなエンジンで巨大なモデルを動かす」という発想は、高価なGPUインフラを必要とせずに最先端AIを一般ユーザーに届けるという、パラダイムシフトを表しています。
その革新性は、洗練されたアーキテクチャにあります。Colibriはモデルの密な部分(注意層、共有エキスパート、埋め込み層——約170億パラメータ)のみをint4量子化(約9.9GB)でRAMに常駐させ、21,504個のルーティングされたエキスパート(合計約370GB)をディスクから必要に応じてストリーミングします。純粋なC言語で書かれ、外部依存やPythonランタイムを一切必要とせず、エンジン全体はわずか約1,300行の単一のCファイルに収まっています。
革命的な技術革新
エキスパート・ストリーミング・アーキテクチャ
モデル全体をメモリに収める必要がある従来の推論エンジンとは異なり、Colibriは MoE モデルの基本的な性質を活用しています。各トークンで活性化されるのはわずか約400億パラメータであり、トークン間で変化するルーティングエキスパートはわずか約11GBです。このエンジンは、オプションでピン留め可能なホットストアを備えた高度な層単位のLRUキャッシュを実装し、OSのページキャッシュを無料の二次キャッシュ層として活用しています。
マルチトークン予測(MTP)による推測的デコーディング
Colibriは、GLM-5.2のネイティブなマルチトークン予測ヘッドを推測的デコーディングに利用し、MTPヘッドにint8量子化を使用した場合、フォワードパスごとに2.2〜2.8トークンを生成し、ドラフトの受理率は39〜59%に達します。この無損失の高速化技術は、拒否サンプリングを通じて、サンプリング下でも品質を維持します。
MLA注意機構による圧縮KVキャッシュ
このエンジンは、圧縮されたKVキャッシュを備えたMulti-head Latent Attention(MLA)を実装し、トークンごとに32,768個ではなくわずか576個の浮動小数点数を格納します——57倍の削減により、限られたRAM上でも長文脈推論が実現可能になります。
最適化された整数カーネル
Colibriは、カスタムのAVX2最適化された整数ドット積カーネル(maddubs命令を用いたQ8_0スタイルのint8活性化)を搭載しており、119 GFLOP/sを達成します。これにより、int8の行列乗算は1.4〜2.5倍、バッチモードでのint4演算は1.8倍高速化されます。
実際の性能と影響
性能指標は、Colibriの実用的な実現可能性を示しています。WSL2、25GBのRAM、約1GB/sのNVMeストレージを備えた開発機では、コールド起動時に0.05〜0.1トークン/秒を達成し、128GBのRAMとより高速なストレージを備えたApple M5 Maxでは約1トークン/秒まで拡張されます。GPUの速度には及ばないものの、これは最先端AIモデルへのアクセスの民主化を表しています。
このエンジンはわずか9.9GBの常駐メモリで約32秒で起動し、中位クラスの民生用ハードウェアでも即座に使用できます。非同期のエキスパート先読みシステムにより、1つのエキスパートブロックが処理されている間に、次のブロックがすでにディスクから読み込まれるため、I/Oのボトルネックが最小限に抑えられます。
Colibriが爆発的な人気を得ている理由
AIアクセスの民主化
Colibriは、最先端モデルが1万ドル以上のGPU環境を必要としないことを証明することで、AIコミュニティの想像力を掻き立てました。ユーザーはこれを「ローカルAIアクセシビリティへの一歩」として称賛し、7440億パラメータモデルを一般的なノートPCにもたらします。この民主化は、クラウドコンピューティングリソースへのアクセスが限られた地域の研究者、開発者、愛好家にとって特に重要です。
オープンソースかつ依存性ゼロ
このプロジェクトの外部依存性ゼロの純粋なC言語実装は、非常にポータブルで検証しやすいものにしています。Apache 2.0ライセンスは、オープンなアクセスを維持しながら商業的な実現可能性を確保しています。GitHubで241個のスターと25個のフォークを獲得し、このプロジェクトはローカルAIコミュニティで急速に支持を広げています。
技術的な卓越性
この実装は、忠実なGLM-5.2フォワードパス検証(transformersオラクルとトークンレベルで完全一致)から、プリフィル時のバッチ統合MoE、C言語によるバイトレベルBPEトークナイザー、MemAvailableからの自動キャッシュサイズ調整によるRAM安全機構といった洗練された機能まで、優れたエンジニアリング力を示しています。この細部への配慮は、技術者からの信頼を得ています。
コミュニティの勢い
このプロジェクトは、Redditのr/LocalLLMやr/LocalLLaMAコミュニティ、Facebook AIグループ、Gigazineなどのテックニュースサイトで議論を呼んでいます。ユーザーはベンチマーク、最適化のヒント、活用例を積極的に共有し、改善と採用の良い循環を生み出しています。
ローカルAIの未来
Colibriは単なる技術的な成果以上のものです——それは、最先端AIがクラウドインフラを必要とするという前提に挑む概念実証です。開発者は現在、ライトニングインデクサーの重みを用いたDSA(スパース注意機構)の実装に積極的に取り組んでおり、これは長文脈シナリオにおける性能をさらに向上させるものです。
一度に1つのシャードずつをダウンロードして処理するオフラインFP8→int4コンバーター(756GBの完全なFP8チェックポイントを保存する必要を回避する)は、ストレージが限られたユーザーへの配慮あるデザインを示しています。この現実世界の制約への注意深さが、Colibriを革新的であるだけでなく、真に実用的なものにしています。
コミュニティの貢献と最適化によってプロジェクトが進化を続ける中、ColibriはローカルAI推論の標準的なツールとなり、エコシステム全体に同様のイノベーションを促し、AIの未来が大規模データセンターに集中する必要はないことを証明する存在になろうとしています。

