AWSはSageMaker JumpStartに3つの特化型モデルを追加した。Redisのセマンティックキャッシング用langcache-embed-v3-small、JetBrainsのMellum2-12B-A2.5B-Thinkingコーディングモデル、そしてLightOnのコンパクトOCRモデルである。
見出しは個別のモデルではなく、そのパターンにある。これらは小規模で目的特化したシステムであり、クラウドカタログを通じて配布され、それぞれがフロンティアLLMのコスト構造における異なる費用項目を攻略する。セマンティックキャッシングは、異なる表現の2つのクエリが同じ意味であることを認識することで、冗長な推論呼び出しを排除する。トークンごとに12Bパラメータのうち2.5Bを活性化するMixture-of-Expertsデザインは、コーディングやエージェントワークフローのレイテンシとサービング費用を削減する。ページ画像を直接読み取る1Bビジョン言語モデルは、企業が長年維持してきた脆弱な多段階OCRパイプラインを不要にする。これらを総合すると、AIスタックのアンバンドリングが起きている。すべてを1つの高価な汎用モデルに送るのではなく、チームは各タスクに対してより安価な専門モデルを組み合わせる。
配信が戦略的ストーリーである。JetBrains、Redis、LightOnがJumpStartを通じて出荷すると、クラウドカタログはAIの発見とデプロイメント層となり、アプリストアがモバイルで果たした役割と同様になる。これはAWS、Azure、Google Cloudの周辺に重力を集中させ、独立したモデルベンダーにカタログ枠を獲得しなければリーチを失うという圧力をかける。購入者にとって、ワンクリックデプロイメントは専門モデルを試す障壁を下げ、モノリシックなモデル契約からの移行を加速する。
日本にとって、OCR部分が最も重要である。ここではバックオフィス業務がPDFと紙中心のままであり、日本語を確実に処理できる多言語文書テキスト化により、企業は既存のAI-OCR製品にパッチを当てるのではなく置き換えることができる。SIerはこれを、より軽量で高速な基盤上で文書処理サービスを再構築する機会として扱うべきであり、RPA統合業者は既存のワークフローボットとコンパクトOCRモデルを組み合わせて、従来のRPAが苦手とする読み取りステップをカバーできる。
コーディングとキャッシングモデルは別の理由で重要だ。プライベートデプロイメントである。コードや顧客データを外部APIに送ることに抵抗がある日本の金融、公共部門、製造業クライアントは、自社のAWSアカウント内で小規模MoEモデルを実行できる。国内開発チームはコスト管理された、アカウント内推論への信頼できる道筋を得て、この組み合わせ――専門モデル、キャッシング、封じ込め――を習得したSIerは、生のモデル能力ではなく総所有コストで差別化できる。