Primate LabsがGeekbench 7をリリースし、ビデオおよびオーディオのエンコード/デコードテスト、再設計されたマルチコアワークロード、そして従来バージョンよりもCPUとGPUに高い負荷をかける重いデータセットを追加した。
戦略的なポイントはソフトウェア自体ではなく、誰が物差しを支配するかである。ベンチマークは、シリコンベンダー、OEM、購入者すべてが基準とする事実上の業界標準となっているが、それらはIntel、Apple、Qualcomm、AMDではなく、小規模な独立企業によって設定されている。各手法の変更は静かに製品の順位を変え、何年にもわたるマーケティング資料を無効化し、'最速チップ'という主張をめぐる物語を変える。単一のテストスイートがメモリ帯域幅を必要とするワークロードを追加すると、広いメモリサブシステムを持つアーキテクチャを有利にし、他を不利にする可能性がある—ツールのアップデートを競争的イベントに変えてしまうのだ。
ベンダーにとってのリスクは、物語のコントロールを失うことである。AppleのMシリーズとQualcommのSnapdragon Xは、ローンチメッセージングにおいてGeekbenchスコアに大きく依存してきた。より厳格なマルチコアモデルは、彼らが宣伝するギャップを圧縮する可能性がある。AIとデータセンタースループットで販売しているAMDとIntelも、同じリスクにさらされている。マーケティングチームが製品ライン全体を再ベンチマークし、バージョン7の下ではもはや成立しない有利な比較を静かに撤回することが予想される。
より深いトレンドは、AI時代におけるベンチマークの断片化である。合成CPU/GPUスコアは、購入者が実際に重視するもの—デバイス上推論、NPUスループット、トークン毎秒、持続負荷下での電力効率—を捉えきれなくなっている。信頼されるAI性能の基準を定義する者—MLPerf、ベンダー公表のTOPS、または新しい消費者向け基準—が、購入に対して過大な影響力を獲得する。ベンダー提供のTOPS数値はすでに一貫性がなく比較が困難であり、独立した仲裁者が埋めることができる信頼性のギャップを残している。
推奨される行動:グローバルテクノロジー企業の調達および製品チームは、ベンチマーク手法を脚注ではなくガバナンスの問題として扱うべきであり、透明で再現可能なスイートを標準化し、見出しスコアよりもワークロード代表的なテストを要求すべきである。デバイスとシリコンサイクルを評価する投資家は、購入者が実際に信頼するベンチマークを追跡すべきである。なぜなら、物語のコントロールがますます需要を動かすからである。そしてチップメーカーは、第三者が基準を再設定した後に反応するのではなく、オープンでAI関連の基準を形成することに早期に投資すべきである。