Coral AI Labsと複数の大学による研究チームは、4つのコーディングエージェントが固定のチェックポイントではなくタスクの途中で知見を交換できるメッセージング層、AgentRadioを構築した。結果として、同じエージェントが単独で作業する場合と比較して精度がほぼ2倍となり、より強力な単一モデルを上回った。
この戦略的シグナルは、ベンチマークの重要性を超えている。2年間、業界は能力をパラメータ数とトレーニング計算量と同一視してきた。本研究は、現実的な企業ワークロードにおいて規模拡大の限界収益が減少していると主張する。単一の最上位モデルは最も困難なコードベースの質問の半分強しか解決できなかったが、協調性の高い弱いエージェントチームは、構造だけでその差の大部分を埋めた。協調が確実にモデル規模の代替となるなら、経済性は変化する。企業は最先端モデルに対してトークン当たりのプレミアム料金を支払う代わりに、より安価なモデルとスマートなオーケストレーションで目標精度を達成できる。
これにより競争環境が再構築される。差別化要因はスタックの上位へと移動し、誰が最大のモデルを訓練するかから、誰が協調層、メモリ、評価ハーネスを所有するかへと変わる。これはアプリケーション層の開発者とプラットフォームプレイヤーに有利に働く。Microsoft、GitHub、Cognition、そしてLangGraphやCrewAIなどのオーケストレーションフレームワークは、純粋なモデルベンダーが自分たちのものと想定していた価値を獲得する立場にある。これはまた、より大規模なモデルがその設備投資を正当化するという最先端ラボの中心的な賭けに圧力をかける。OpenAI、Anthropic、Googleは、オーケストレーションを自社エコシステム内に留めるため、ネイティブなマルチエージェントツールを加速させると予想される。
リスクは現実的だが限定的である。非同期協調は新たな失敗モードを追加する。メッセージストーム、途中での矛盾する修正、そして4つのエージェントが互いの計画を書き換える際のデバッグの不透明性である。企業はこれを本番環境対応とみなすべきではない。賢明な動きは、厳格な可観測性とコスト上限を設け、単一モデルベースラインと比較してドル当たりの精度を測定しながら、社内のコードベース理解タスクで管理されたパイロット運用を行うことである。
推奨アクション:CTOは、大規模な推論契約を更新する前に、自社のリポジトリで最先端の単一エージェントと協調的な低コストモデルチームの比較試験を実施すべきである。投資家は、モデルへの投資と並行して、オーケストレーション、エージェントの可観測性、評価インフラストラクチャを重視すべきである。これらの層が今や防御可能なマージンを保持している。2025年の広範なテーゼ:最先端の利益が圧縮されるにつれ、システム設計が企業向けAIの価値が勝ち取られる舞台となる。