Anthropicは2026年9月28日、Claude Sonnet 5.5を発表した。Sonnet 5と同じAPIトークン単価を保ちながら、同社のテストではタスク単位の費用を最大30%抑え、出力生成を30%以上速めたという。
単価を下げたのではなく、同じ作業を終えるまでに使うトークンや処理手順を減らす考え方だ。どの仕事でも同じ幅で安くなるわけではないため、料金表の数字と実作業の費用を分けて見る必要がある。
トークン単価は据え置き、作業あたりの費用を抑える
Anthropicによると、Sonnet 5.5のAPI価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドル。Sonnet 5と同額で、キャッシュ読み取りは100万トークンあたり0.20ドルだ。キャッシュ書き込みは同100万トークンあたり2.50ドルとなる。
同社は、Sonnet 5.5が同じ作業に必要とするトークンを減らし、出力生成も30%以上速めたと説明する。そのため、トークン単価が同じでも、作業完了までに消費する量が少なければタスク全体の支払いは下がる。Anthropicのテストではタスク費用が最大30%低くなったが、これは同社が測った作業での結果だ。
ベンチマークは測定内容と設定をそろえて読む
Anthropicの発表では、Terminal-Bench 4.0でSonnet 5.5は70.6%、Sonnet 5は10.3%だった。この評価は、コマンドライン上で複数段階の専門的な作業を完了する能力を測る。Sonnet 5.5はClaudeアプリの既定であるMedium effortで評価された一方、Opus 5.5の66.4%は同モデルの最高値となるXhigh effortでの結果だ。設定が異なるため、数字だけでモデル全体の優劣を決める比較にはならない。
FrontierCode 1.1は、エージェントが作ったコード変更を人の編集なしでマージできるかを評価する。Sonnet 5.5はXhighで52.1%、Maxで46.2%だった。Anthropicの脚注では、評価は依頼の範囲を外れる変更を減点する。Maxではコードレビュー用スキルが多数のサブエージェントを起動し、調査した2例ではタイムアウトや範囲外の編集が低スコアにつながったという。
GDPval-AA v2.1は44職種、9つの主要産業にまたがる実務タスクを扱う評価だ。Sonnet 5.5のスコアは1844、Sonnet 5は1449、Opus 5.5は1846だった。Sonnet 5.5はこの評価でOpus 5.5を2ポイント下回ったが、あらゆる実務で両モデルが同等という意味ではない。
このGDPval-AAなど一部の外部評価は、構造化出力を劣化させる不具合があったリリース前環境で実施された。Anthropicによると、その不具合は修正済みで、影響があればSonnet 5.5の結果を低く見せた可能性がある。ベンチマークの数値は測定条件と脚注を含めて読む必要がある。