GoogleのGemma 4 12Bは、大きいほど良いというコンセンサスに対する意図的なカウンタームーブだ。寛容なApache 2.0ライセンスの下で約120億パラメータを持ち、標準的な16GBのノートPCでローカルに音声、動画、テキストを処理する。この制約こそが戦略であり、制限ではない。
技術の核心はエンコーダー不要の「Unified」アーキテクチャだ。従来のマルチモーダルシステムは、別個のビジョンエンコーダーとオーディオエンコーダーを言語バックボーンに接続し、レイテンシとメモリオーバーヘッドを増加させる。Gemma 4はこれを統合する。ビジョンエンコーダーは3500万パラメータの線形射影に縮小され、オーディオエンコーダーは完全に消滅し、生の波形と視覚パッチがLLM埋め込み空間に直接流れ込む。実用的な成果――低い推論レイテンシ、16GB未満のVRAM、シングルパスのファインチューニング――は、企業アーキテクトにとって、さらなるベンチマークの限界的な向上よりも重要だ。
戦略的な意味合いは、AI市場の二極化だ。最先端モデル競争がデータセンターGPUに資本を燃焼させる中(そしてTSMCは今やAIチップ需要を満たせないことを公然と認めている)、Googleは反対の端に種を蒔いている。クラウドAPIに一切触れない有能なモデルだ。規制された分野――医療、金融、防衛、法務――にとって、オフラインでデバイス上のマルチモーダルAIは、データ保存に関する懸念とトークンごとのコストを完全に回避する。25万6000トークンのコンテキストウィンドウとネイティブなツール使用により、単なるデモではなく、実際のエージェント型ワークフローに対応可能だ。
経営幹部にとって、計算が変わる。OpenAIやAnthropicのAPI支出に縛られているチームは、大量処理、プライバシー重視、またはレイテンシが重要なタスクでGemma 4を試すべきだ。最先端の能力の90%をほぼゼロの限界コストで得られる場合に勝機がある。リスクは、オープンウェイトが推論レイヤーをコモディティ化し、APIプロバイダーの価格設定に圧力をかけ、ハイパースケーラーのバリュエーションを正当化する堀を侵食することだ。これはまさに、Broadcomの決算後の今週のAI株ローテーションに反映された不安だ。
より広範な戦略はエコシステムの獲得だ。Hugging Face、Kaggle、AI Edge Galleryで無料配布することで、Googleは直接的な収益化を開発者のマインドシェアと下流のクラウドへの誘引と交換している。これはAIに適用されたAndroid型の論理と同じだ。投資家は、「十分に良いローカルAI」が、業界の能力拡大が想定するよりも速く、プレミアムクラウド推論の対応可能市場を圧縮するかどうかを注視すべきだ。