ベンチマーク

Claude Sonnet 5料金恒久化とManaged Agents新課金

Claude Sonnet 5料金恒久化とManaged Agents新課金

この記事の結論

Claude Sonnet 5の$2/$10料金が恒久化、9月予定の$3/$15値上げは中止に。Managed Agentsのトークン+セッション時間の二軸課金を公式数値で再現し、エージェント運用コストの試算方法を整理します。

Claude Sonnet 5の100万トークンあたり入力$2/出力$10という料金は、2026年8月31日までの導入価格(introductory pricing)から標準価格に恒久化されました。2026年9月1日に予定されていた$3/$15への値上げは実施されません。

  • 値上げ中止はAnthropic公式Pricingドキュメントに明記済み(参照日: 2026-08-24)
  • Claude Managed Agentsは「トークン課金+セッションランタイム$0.08/セッション時間」の二軸課金
  • Managed AgentsセッションにはBatch API割引とCloud platform pricingが適用されない点に注意

8月最終週、来期のAPI予算シートを開いて、9月以降のClaude Sonnet 5の単価セルを$3/$15に書き換える作業をしていた——そんな開発チームやPMの方は少なくないはずです。Sonnet 5はローンチ時に「2026年8月31日までの導入価格」として$2/$10が提示されていたため、9月からの1.5倍値上げを織り込んだコスト計画を組むのが、これまでの堅実な判断でした。ところがAnthropicの公式Pricingドキュメントが更新され、この値上げ計画そのものが撤回されたことが確認できました。あわせて、Claude Managed Agentsの課金体系として「トークン+セッション時間」の二軸モデルが公式ドキュメントに掲載されています。予算シートを書き換える前に、一次情報の数値をそのまま追いながら、何がどう変わったのかを整理していきましょう。

値上げ予定はどうなったのか — 公式ドキュメントの記述を確認する

まず一次情報から確認します。Anthropicの公式Pricingドキュメント(platform.claude.com/docs/en/about-claude/pricing)には、Claude Sonnet 5について次のNoteが掲載されています(参照日: 2026-08-24)。

The $2/$10 per million input/output token pricing for Claude Sonnet 5, announced at launch as introductory pricing through August 31, 2026, is now the standard price. The previously scheduled increase to $3/$15 per million input/output tokens on September 1, 2026 will not occur.

ポイントは2つです。第一に、$2/$10(100万トークンあたり入力$2・出力$10)は「導入価格」ではなく標準価格(standard price)になりました。第二に、2026年9月1日に予定されていた$3/$15への値上げは「will not occur」、つまり実施されないと明言されています。期限延長ではなく、値上げ計画自体の撤回です。

恒久化されたSonnet 5の料金体系を、プロンプトキャッシュ・Batch APIまで含めて公式ドキュメントの数値のまま整理すると次のとおりです。

課金項目 Claude Sonnet 5の単価 備考
入力トークン(Base Input) $2 / MTok 標準価格として恒久化
出力トークン(Output) $10 / MTok 同上
キャッシュ書き込み(5分) $2.50 / MTok 基準入力価格の1.25倍
キャッシュ書き込み(1時間) $4 / MTok 基準入力価格の2倍
キャッシュヒット(読み取り) $0.20 / MTok 基準入力価格の0.1倍
Batch API 入力 $1 / MTok 入出力とも50%割引
Batch API 出力 $5 / MTok 同上

MTok=100万トークンです。なお、今後さらに価格が変わる予定があるかどうかについては、現時点で公式発表はありません。この記事で扱うのは、2026年8月24日時点で公式ドキュメントに記載されている内容のみです。

$2/$10恒久化で開発コスト計画はこう変わる

値上げを織り込んで予算を組んでいたチームにとって、この恒久化は「9月以降のコストが計画比で下振れする」ことを意味します。単純化した数字で見てみましょう。

以下は編集部による試算です(公式の単価に月間トークン量を掛けただけの機械的な計算で、実測値ではありません)。月間で入力1億トークン・出力2,000万トークンをSonnet 5で処理するワークロードを想定します。

シナリオ 入力コスト 出力コスト 月額合計
値上げ後を想定した旧計画($3/$15) 100M × $3/M = $300 20M × $15/M = $300 $600
恒久化された現行価格($2/$10) 100M × $2/M = $200 20M × $10/M = $200 $400
現行価格 + Batch API($1/$5) 100M × $1/M = $100 20M × $5/M = $100 $200

このワークロードでは、旧計画比で月$200、率にして約33%の下振れです。さらに非同期処理で許容できるジョブをBatch APIに寄せれば、値上げを想定していた旧計画の3分の1の水準まで下がります。9月以降の予算をすでに$3/$15ベースで確保しているなら、その差分を検証環境の拡充やより上位モデル(Opus 5は入力$5/出力$25)の部分投入に回す、という組み替えも現実的な選択肢になります。

Sonnet 4.6からの移行では「トークナイザー差」に注意

単価だけを見るとSonnet 4.6($3/$15)からSonnet 5($2/$10)への移行で3分の2にコストが下がるように見えますが、ここには落とし穴があります。公式ドキュメントのNoteによれば、Claude 4.7以降のモデルは新しいトークナイザーを採用しており、同じテキストに対して約30%多くトークンを生成するとされています(増加幅はコンテンツとワークロードの形状に依存)。Sonnet 4.6以前は旧トークナイザーです。

つまりSonnet 4.6からSonnet 5に移行する場合、単価は下がる一方でトークン消費量は増える可能性があり、請求額の削減率は「単価の差分」より小さくなり得ます。移行前後で同一ワークロードのトークン数を実測して比較するのが確実です。

Managed Agentsの課金は「トークン+セッション時間」の二軸になった

もう1つの確認ポイントが、Claude Managed Agentsの課金体系です。Managed Agentsそのものの概要・アーキテクチャは既に別記事で扱っているため、ここでは課金モデルの差分だけを見ていきます。仕組み自体を先に押さえたい方はClaude Managed Agentsの解説記事を先に読んでください。

公式Pricingドキュメントによると、Managed Agentsは次の2つのディメンションで課金されます。

軸1: トークン課金 — 通常のModel pricingと同率

セッション内で消費される全トークンは、通常のModel pricingと同じ単価で課金されます。Sonnet 5なら$2/$10、Opus 5なら$5/$25です。プロンプトキャッシュの倍率もそのまま適用され、セッション内でWeb検索が発動した場合は標準の「1,000検索あたり$10」が加算されます。エージェントのmodel.speed"fast"に設定した場合はFast modeのプレミアム価格、model.inference_geo"us"に固定した場合は1.1倍のデータレジデンシー係数が適用されます。

一方で、Messages APIで使える次の2つのモディファイアは、Managed Agentsセッションには適用されません

適用されないモディファイア 公式ドキュメント記載の理由
Batch API割引(50%オフ) セッションはステートフルかつ対話的であり、バッチモードが存在しないため
Cloud platform pricing パートナー運営のクラウドプラットフォームでは利用不可のため

「Sonnet 5をBatch APIで$1/$5にして安く回す」という定番の最適化がManaged Agentsでは使えない、という点はコスト設計上の重要な制約です。

軸2: セッションランタイム — $0.08/セッション時間

トークンとは別に、セッションの稼働時間に対して課金が発生します。公式の料金表は次のとおりです。

SKU レート 計測対象
Session runtime $0.08 per session-hour runningステータスの継続時間

ここで見落としやすいのが計測条件です。ランタイムはミリ秒単位で計測されますが、課金対象になるのはセッションのステータスがrunningの間だけです。次のメッセージやツール実行の確認を待っているidlereschedulingterminatedの時間は課金対象になりません。また公式Noteによれば、Managed Agents利用時はセッションランタイム課金がCode execution(コード実行ツール)のコンテナ時間課金を置き換えるため、コンテナ時間が二重に請求されることはありません。

公式Worked exampleを手元で再現する

二軸課金の実際の金額感は、公式ドキュメントに掲載されているWorked example(計算例)をなぞるのが一番わかりやすいです。題材は「Claude Opus 5を使った1時間のコーディングセッションで、入力50,000トークン・出力15,000トークンを消費した」ケースです。

項目 計算式 コスト
入力トークン 50,000 × $5 / 1,000,000 $0.25
出力トークン 15,000 × $25 / 1,000,000 $0.375
セッションランタイム 1.0時間 × $0.08 $0.08
合計 $0.705

1時間のOpus 5セッションで$0.705。内訳を見ると、ランタイム$0.08は全体の1割強で、支配的なのはトークンコストです。さらに公式ドキュメントには、プロンプトキャッシュが効いた場合の計算例も掲載されています。入力50,000トークンのうち40,000トークンがキャッシュ読み取りだった場合です。

項目 計算式 コスト
非キャッシュ入力トークン 10,000 × $5 / 1,000,000 $0.05
キャッシュ読み取りトークン 40,000 × $5 × 0.1 / 1,000,000 $0.02
出力トークン 15,000 × $25 / 1,000,000 $0.375
セッションランタイム 1.0時間 × $0.08 $0.08
合計 $0.525

キャッシュが効くと$0.705が$0.525になり、約26%の削減です。Batch割引が使えないManaged Agentsにおいて、プロンプトキャッシュが実質的に唯一の大きなコスト削減レバーになることがこの2つの例から読み取れます。

自社エージェントの運用コストを試算する手順

公式Worked exampleの構造をそのまま関数化すれば、自社エージェントの月間運用コストは簡単に試算できます。計算式は「入力トークン×入力単価 + 出力トークン×出力単価 + セッション時間×$0.08」だけです。

次のコードは、公式の計算例と同じロジックをPythonで再現したものです。

# 動作環境: Python 3.10+(外部パッケージ不要)
# 注意: 本番環境で使用する前に、必ずテスト環境で動作確認してください。
# 単価は2026-08-24時点の公式Pricingドキュメントの値。変更される可能性があるため
# 使用前に https://platform.claude.com/docs/en/about-claude/pricing で最新値を確認すること。

PRICES = {  # (入力$/MTok, 出力$/MTok)
    "sonnet-5": (2.0, 10.0),   # 恒久化された標準価格
    "opus-5":   (5.0, 25.0),
    "haiku-4.5": (1.0, 5.0),
}
SESSION_HOUR_RATE = 0.08   # Managed Agents: $0.08 per session-hour
CACHE_READ_MULTIPLIER = 0.1  # キャッシュ読み取りは基準入力価格の0.1倍

def managed_agent_session_cost(model, input_tokens, output_tokens,
                               session_hours, cached_input_tokens=0):
    """Managed Agents 1セッションのコストをUSDで返す"""
    in_price, out_price = PRICES[model]
    uncached = input_tokens - cached_input_tokens
    cost_in = uncached * in_price / 1_000_000
    cost_cache = cached_input_tokens * in_price * CACHE_READ_MULTIPLIER / 1_000_000
    cost_out = output_tokens * out_price / 1_000_000
    cost_runtime = session_hours * SESSION_HOUR_RATE  # runningステータスの時間のみ
    return round(cost_in + cost_cache + cost_out + cost_runtime, 4)

# 公式Worked exampleの再現: Opus 5 / 1時間 / 入力50,000・出力15,000
print(managed_agent_session_cost("opus-5", 50_000, 15_000, 1.0))
# => 0.705

# キャッシュ版: 入力のうち40,000がキャッシュ読み取り
print(managed_agent_session_cost("opus-5", 50_000, 15_000, 1.0,
                                 cached_input_tokens=40_000))
# => 0.525

ポイントは次の3つです。

  • session_hoursにはrunningステータスの時間だけを入れる(idle時間を含めると過大見積もりになる)
  • キャッシュ読み取りは基準入力価格の0.1倍。キャッシュ書き込み(1.25倍/2倍)を厳密に扱いたい場合は項目を追加する
  • Web検索を使うエージェントは「1,000検索あたり$10」を別途加算する

あとは「1セッションあたりの平均トークン量・平均running時間」と「月間セッション数」を掛け合わせれば月次予算になります。実測ベースの平均値はセッションログから取るのが確実です。トークン消費の継続的なモニタリング設計についてはAIエージェントのコスト監視の解説記事も参考にしてください。

見積もりでつまずきやすいポイント

実際にコスト試算をレビューしていると、同じパターンの見積もりミスをよく見かけます。代表的な3つを挙げます。

その1: セッション時間を「壁時計の時間」で見積もる

❌ エージェントを8時間立ち上げているから 8 × $0.08 = $0.64/日 と計算する
runningステータスの実時間だけを集計する

なぜ重要か: 課金対象はrunningステータスの継続時間のみで、ユーザーの入力待ちなどのidle時間は課金されません。対話型エージェントでは壁時計の時間とrunning時間が大きく乖離するため、前者で見積もると大幅な過大計上になります。

その2: Batch API割引を織り込んでしまう

❌ 「Sonnet 5はBatchで$1/$5だから」とManaged Agentsの試算に50%割引を適用する
⭕ Managed AgentsセッションはBatch割引非適用。定価の$2/$10で計算し、削減はプロンプトキャッシュで狙う

なぜ重要か: 公式ドキュメントに「セッションはステートフルかつ対話的でバッチモードが存在しない」と明記されています。割引前提の試算は承認後に2倍の請求ギャップを生みます。

その3: 旧モデルとの単価差をそのまま削減率にする

❌ Sonnet 4.6→Sonnet 5移行で「単価が2/3になるからコストも33%減」と報告する
⭕ 新トークナイザーで同一テキストのトークン数が約30%増え得ることを注記し、移行前後で実測比較する

なぜ重要か: 削減率を過大に約束すると、実際の請求額との差分の説明責任が後から発生します。単価と消費量は分けて報告するのが安全です。

よくある質問

Sonnet 5の料金は今後また変わる可能性がありますか?

公式ドキュメントには$2/$10が「標準価格になった」と記載されており、次の価格改定に関する予定は現時点で公式発表がありません。API単価は変更され得るものなので、四半期ごとの予算策定時に公式Pricingページを確認する運用をおすすめします。

Managed Agentsのセッションがidleで放置されたら課金され続けますか?

されません。セッションランタイム課金はrunningステータスの継続時間だけをミリ秒単位で計測します。idlereschedulingterminatedの時間はランタイム課金の対象外です。

Managed Agentsでコード実行ツールを使うとコンテナ時間が別途かかりますか?

かかりません。公式Noteによれば、Managed Agents利用時はセッションランタイム課金がコード実行のコンテナ時間課金モデルを置き換えるため、セッションランタイムに加えてコンテナ時間が別途請求されることはありません。

最後に確認すべきこと

今回の公式ドキュメント更新を予算に反映する前に、次の点をチェックしておきましょう。

  • 9月以降の予算シート: Sonnet 5を$3/$15で組んでいた場合は$2/$10に修正する。値上げは「実施されない」と公式に明記済み
  • Sonnet 4.6からの移行判断: 単価差だけでなく、新トークナイザーによる約30%のトークン増を織り込んで実測比較する
  • Managed Agentsの試算式: 「トークン×Model pricing + running時間×$0.08」。Batch割引・Cloud platform pricingは非適用、削減レバーはプロンプトキャッシュ
  • Worked exampleでの検算: Opus 5・1時間・50,000/15,000トークンで$0.705(キャッシュ40,000読み取り時$0.525)。自作の試算スクリプトがこの値を再現できるか確認する

あわせて読みたい:

参考・出典

この記事を読んで導入イメージが固まってきた方へ

UravationではAIエージェント導入の研修・コンサルを行っています。

この記事はAIgent Lab編集部がお届けしました。

Need help moving from reading to rollout?

この記事を読んで導入イメージが固まってきた方へ

Uravationでは、AIエージェントの要件整理、PoC設計、社内導入、研修まで一気通貫で支援しています。

この記事をシェア

X Facebook LINE

※ 本記事の情報は2026年8月時点のものです。サービスの料金・仕様は変更される可能性があります。最新情報は各サービスの公式サイトをご確認ください。

関連記事