CactusはNeedle2を発表した。これは14MBのエージェント型LLMで、45Mパラメータと2ビット圧縮により28MBのRAMでフルセッションを実行し、Raspberry Pi 5で500トークン/秒、200ドル以下のスマートフォンで300〜700トークン/秒を達成する。

タイミングこそが本質である。Wall Streetが集中型AIインフラに数千億ドルを投じる中、Needleは正反対の命題を提示する。世界の210億台の接続デバイスのほとんどはデータセンターに接続することはなく、「エッジAI」の議論を支配する15億台のMacとPCは、低価格スマートフォン、マイコン、ウェアラブル、小型ロボットと比較すれば誤差範囲に過ぎない。経済的論点は精度ではなく電力である。常時稼働のアシスタントでは、すべてのMFLOPがミリワット時であり、70対87〜164を消費するモデルの違いが、バッテリー制約のあるハードウェアが何をホストできるかを根本的に変える。その背後にある戦略的賭けは、見かけより狭く鋭い。消費者向けインテリジェンスを型付き関数として捉えれば、唯一の難題は乱雑な文を適切な呼び出しにマッピングすることであり、これには世界知識も自由形式の文章も必要ない。だからこそ45Mパラメータが大型の小規模モデルと対等に戦えるのだ。これはまた、フロンティア推論と競合するのではなく、クラウドとのラウンドトリップと競合することを意味する。

日本にとって、この適合性は異例なほど明確である。ここはロボティクス、ファクトリーオートメーション、民生機器の経済圏であり、データ居住性ルール、工場フロアのレイテンシ、オフライン信頼性により、クラウド依存は利便性ではなく負債となる。デバイス上でのツール呼び出しにより、メーカーやデバイスメーカーは、金融や医療の導入における送信コストやコンプライアンス上の露出なしに知能を組み込むことができる。

SIerにとって、興味深いレバーはカスタマイズの経済性である。MacやPCで数分から数時間、少数のサンプルからファインチューニングできるモデルは、特化型垂直インテリジェンスを研究プロジェクトではなく再現可能なエンゲージメントに変える。不確実な場合にのみローカルで動作し、より大きなモデルにエスカレートする信頼スコア閾値と組み合わせることで、日本企業のリスク許容度に正確にマッピングされる。安価で、封じ込められ、監査可能で、明確なフォールバックを持つ。

RPAベンダーはこれをプレッシャーとして読むべきである。日本のRPAの多くはNeedleがターゲットとする同じ問題、つまり非構造化入力を構造化アクションに変換することを自動化しているが、脆弱なルールと、ますます増加するクラウドLLM呼び出しによってそれを実現している。渡されたスキーマに対して構造化出力を返すデバイス上のモデルは、認識層の信頼できる代替となり、コストとプライバシーの懸念を一度に解消する可能性がある。未解決の問題は耐久性である。2ビット、45Mパラメータのモデルはエッジケースに対する余裕がほとんどないため、短期的な勝利は限定的でスキーマ駆動型のタスクであり、一般的な自律性ではない。