Googleの最新Geminiモデルは、開発者が長年ランダム性と決定性を調整するために使用してきた3つのダイヤル、temperature、top_p、top_kを無視するようになった。APIの些細な注釈のように見えるが、これは哲学的な転換である。推論制御が顧客からプロバイダーへと移行しているのだ。
10年間、サンプリングパラメータは生成AIの共通言語だった。決定的な抽出のためにtemperatureをゼロに設定し、創造的な下書きのために少し上げる、という知識はOpenAI、Anthropic、Mistral、オープンウェイトスタックを横断して移植可能だった。Googleは、自社モデルが手動調整されたダイヤルよりも出力品質を自己調整できるようになったと賭けており、それらを抽象化することでサポート負担と設定ミスを削減できると考えている。その代償は制御だ。固定temperatureの再現性を中心に評価ハーネス、回帰テスト、コンプライアンスワークフローを構築したチームは、依存していた保証を失う。
戦略的な含意はロックインだ。最先端ラボが推論パイプラインをより多く内部化するにつれ、移植性のための表面積は縮小する。Geminiの不透明なサンプリング動作に合わせて調整されたプロンプトは、もはや競合他社に明確にマッピングできず、GoogleがFlashティアを刷新しProリリースを保留するまさにそのタイミングで、スイッチングコストが上昇する。マルチモデルレジリエンスを最適化する企業は、これを警告として受け止めるべきだ。プロバイダー固有の動作は、例外ではなく、静かに標準になりつつある。
規制対象セクターには具体的なリスクがある。監査可能性のために決定的な出力に依存するフィンテックやヘルステックの展開は、完全に抑制できない非決定性に直面する。temperature zeroでバイト同一の応答を前提とするパイプラインは再検証が必要であり、制御されたランダム性を引用する法的または安全性文書は、もはや有効でない可能性がある。
推奨アクション: パラメータを正規化しプロバイダーの癖を吸収する内部ゲートウェイの背後にモデル呼び出しを抽象化する。出力の分散を測定する評価スイートを拡張し、それを前提としない。そして、Anthropic、OpenAI、オープンウェイトオプションにまたがるマルチベンダー態勢を正式化し、単一のロードマップ決定がスタックを座礁させないようにする。投資家への広範なシグナルは、推論がマネージドサービスになりつつあり、差別化が調整可能なノブから独自のデフォルトに移行しているということだ。