PLUS

生成AIコラム

一覧に戻る

うさぎでもわかる Claude Sonnet 5 〜Opus級の力をSonnet価格で〜

はじめに

2026年6月30日(米国時間、日本時間だと7月1日)、AnthropicがClaudeの中位モデル「Sonnet」系列の最新版、「Claude Sonnet 5」を発表しました。

Sonnet系列といえば、Claude Sonnet 3.5や3.6、3.7の頃から「エージェント的にコードを書ける」実力で開発者に愛されてきたモデルです。ただ直近は、その手のエージェント性能の伸びしろがOpus系列に偏りがちでした。今回のSonnet 5は、そのOpusとの差を一気に縮めにきた一手です。

本記事は2026年7月時点の公開情報を元にしています。公式発表、システムカード、国内外のメディア報道をもとに、Sonnet 5の概要、Sonnet 4.6からの変更点、実際の使われ方、そして総括までをまとめて整理していきます🐰

先に結論(このあと詳しく解説します)

  • 2026年6月30日、AnthropicがSonnet系列最新モデル「Claude Sonnet 5」を発表
  • 位置づけは「もっともエージェント的なSonnetモデル」、上位モデルOpus 4.8に迫る性能を低価格で提供
  • ベンチマークはSWE-bench ProやOSWorld-Verifiedなど主要指標でSonnet 4.6を明確に上回り、一部はOpus 4.8にほぼ並ぶ
  • 価格は導入価格として2026年8月31日まで入力2ドル 出力10ドル、その後は標準の入力3ドル 出力15ドル(Sonnet 4.6と同額)
  • ただし新しいトークナイザーの影響で、同じ文章でもトークン数が最大1.35倍程度に増えるため、実質的にはコスト中立に近づくよう価格設計されている
  • 安全性はSonnet 4.6より向上、Sonnet系列として初めてリアルタイムのサイバーセキュリティ防護機能も標準搭載
  • 早期アクセスパートナーからは「以前は途中で止まっていたタスクを最後までやり切る」という声が多い

それでは、ひとつずつ見ていきましょう🐰

生成AIの社内利用をお考えの企業様へ 
ナレフルチャットは初心者でも使いやすい設計で、組織全体への生成AI浸透を支援するツールです。プロンプト自動生成機能や社内共有機能により、AIリテラシーに差があっても全員が活用できます。企業のAI導入を検討している方は、こちらをご覧ください。

Claude Sonnet 5 とは

まずはスペックと提供範囲を一覧で押さえておきます。似た名前のモデルが並ぶことがあるので、表記はしっかり確認してくださいね。

項目内容
モデルファミリーClaude Sonnet シリーズ最新版
発表日2026年6月30日(米国時間)
開発元Anthropic
APIモデル名claude-sonnet-5
提供開始発表当日から全プランで利用可能
コンテキストウィンドウ100万トークン(既定かつ上限、小さいコンテキスト版は無し)
最大出力128,000トークン

出典 Anthropic「Introducing Claude Sonnet 5」Claude Platform Docs「What’s new in Claude Sonnet 5」

提供範囲も広く、次のプラン、プロダクトで使えます。

  • Claude Free、Pro(既定モデルとして自動的に使われます)
  • Claude Max、Team、Enterprise(選択式)
  • Claude Code、Claude Platform
  • Amazon Bedrock、Claude Platform on AWS
  • Google Cloud(Claude on Google Cloud)
  • Microsoft Foundry(プレビュー)

過去モデルとの違い 何が変わったのか

ここからは、前身のSonnet 4.6と比べて何が変わったのかを、ベンチマーク、価格、安全性の3つの切り口で見ていきます。

ベンチマークで見る性能向上

数字がいちばん分かりやすいところから見てみましょう。主要な評価指標は次の5つです。

  • SWE-bench Pro 実務寄りのエージェント型コーディング能力を測る
  • Terminal-Bench 2.1 ターミナル操作を伴うタスク遂行能力を測る
  • OSWorld-Verified 画面操作エージェントとしてのコンピュータ操作能力を測る
  • GDPval-AA v2 レポート作成や分析といったナレッジワークの実力を測る
  • Humanity’s Last Exam 幅広い専門知識と推論力を、ツールなし ツールありの両方で測る

これらの結果をまとめたのが、Anthropic公式のベンチマーク比較です。


出典 Anthropic「Introducing Claude Sonnet 5」(Sonnet 4.6のHumanity’s Last ExamとOSWorld-Verifiedのスコアは、採点方法の改定に伴いSonnet 5発表時点の数値に更新されたものです)

注目したいのが、ナレッジワークを測るGDPval-AA v2です。Sonnet 5(1,618)が、上位モデルであるはずのOpus 4.8(1,615)をわずかに上回っています。すべての指標でOpusに届くわけではありませんが、少なくとも日常のレポート作成や分析といった知識労働の領域では、Sonnet 5が肩を並べる場面が出てきているということですね。

Anthropicは「effort」レベルという仕組みも用意しています。これは推論にかける処理量を調整するパラメータで、コストを抑えたいときはlow、精度を優先したいときはhighやxhigh(extra high)を選べます。


出典 Anthropic「Introducing Claude Sonnet 5」

グラフを見ると、Sonnet 5(オレンジ)はSonnet 4.6(グレー)よりも一貫して上のラインにいて、しかもeffortレベルを上げていくとOpus 4.8(黄色)にかなり近づくポイントも出てきます。つまり「普段は中程度のeffortで安く済ませて、ここぞという場面だけeffortを上げる」という使い方ができるわけです。

数字だけ見るとOpusとの差がかなり縮まっている印象を受けます。ベンチマークの種類によっては逆転している項目もあるので、「SonnetはOpusの廉価版」という以前のイメージは、そろそろアップデートしたほうがよさそうです🐰

新しいトークナイザーと価格

性能面と並んで大事なのが、価格まわりの変更です。ここは実際に運用しているとつまずきやすいポイントなので、少していねいに説明します。

Sonnet 5は、Opus 4.7で導入されたのと同じ系統の新しいトークナイザーを採用しています。トークナイザーとは、文章をAIが扱う最小単位(トークン)に分割する仕組みのことです。この変更により、同じ文章を入力しても、Sonnet 4.6のときよりトークン数がおおむね1.0〜1.35倍(平均で3割ほど)増える計算になります。

価格そのものは、次のように設定されています。

期間入力(100万トークンあたり)出力(100万トークンあたり)
導入価格(〜2026年8月31日)2ドル10ドル
標準価格(2026年9月1日〜)3ドル15ドル
参考 Sonnet 4.6(従来)3ドル15ドル
参考 Opus 4.85ドル25ドル

出典 Anthropic「Introducing Claude Sonnet 5」

標準価格だけを見るとSonnet 4.6と同額ですが、トークナイザーの変更で消費トークン数自体が増えるため、Anthropicは導入価格の値引き幅を「移行がおおむねコスト中立になるように」調整したと説明しています。つまり、名目上の値下げというより「実質的な価格を据え置きつつ、しばらくはお得に使える」設計に近いイメージです。

もしSonnet 4.6の頃のトークン使用量やmax_tokensの設定をそのまま使い回していると、想定より早く出力が打ち切られたり、コスト見積もりがずれたりすることがあります。移行時は、実際のプロンプトでトークン数を測り直すことをおすすめします。

安全性とサイバー防護のアップデート

性能の話が続いたので、ここからは安全性まわりです。Anthropicらしく、良い点だけでなく弱点もはっきり公開しているので、そのまま紹介します。

まず良くなった点です。

  • ハルシネーション(事実と異なる回答をしてしまうこと)の発生率がSonnet 4.6より低下
  • sycophancy(ユーザーに合わせて誤ったことでも賛成してしまう傾向)も低下
  • プロンプトインジェクション攻撃(隠された指示でAIを誤動作させる攻撃)への耐性が向上
  • 悪意あるリクエストを拒否する精度が向上

そのうえで、Sonnet 5はSonnet系列としては初めて、リアルタイムのサイバーセキュリティ防護機能を標準搭載しました。危険性の高いサイバーセキュリティ関連の依頼は、リアルタイムで検出されブロックされます。この防護レベルはOpus 4.7やOpus 4.8と同じ基準で、以前紹介したFable 5ほど厳格ではありません。

もしAPIを使っていて依頼が拒否されても、それはエラーではありません。stop_reasonの値がrefusalになったHTTPステータス200の応答として返ってくる仕様なので、慌てずに正常な応答として扱ってください。エラーハンドリングを組む際は覚えておくとよいポイントです。

自動化された行動監査(さまざまな状況でAIが望ましくない行動を取らないかを測るテスト)でも、Sonnet 5はSonnet 4.6より全体的に安全側のスコアを示しています。


出典 Anthropic「Introducing Claude Sonnet 5」

ここで正直に書いておきたいのが弱点です。Sonnet 5は、Opus 4.8やMythos Previewと比べると、この自動行動監査でやや高めの不整合行動率を示しています。またサイバーセキュリティ関連のタスクについては、意図的な訓練を行っていないため、OpusやMythosクラスのモデルよりも大幅に性能が低いとAnthropicは説明しています。

実際、Mozillaと共同で実施したFirefoxの脆弱性を使った検証では、Sonnet 5は完全に動作するエクスプロイト(攻撃コード)の作成には一度も成功していません(成功率0.0%)。ただし部分的な成功率はSonnet 4.6よりやや高く、これは専用の訓練というより全体的な知能向上の副次効果だとAnthropicは分析しています。


出典 Anthropic「Introducing Claude Sonnet 5」(検証で使われた脆弱性はFirefox 148で修正済みです)

数字と仕様の話が続いて少し疲れたかもしれませんが、ここまでが土台の部分です。お疲れさまでした、ここからは実際の使い心地の話に入っていきますね🐰

法人向け生成AIサービス「ナレフルチャット」では、最新版の Claude Sonnet 5 を含む主要プロバイダの最新モデル(ChatGPT、Gemini、Claude など)を選んでご利用いただけます。用途に応じて、高性能な Claude Sonnet 5 をレポート作成やコーディング支援に使い、簡易な問い合わせはより低料金モデルに振り分けるといった、現場ニーズに合わせた最適なAI活用が可能です。
初月無料で生成AIが利用できるトライアル期間も用意しておりますので、生成AIの利活用を検討している企業様は、是非一度導入をご検討ください。

実際の使用感

ベンチマークの数字だけでなく、実際に使ってみた人たちがどう感じているのかも気になるところですよね。ここではAnthropic公式が公開している早期アクセスパートナーの声と、国内外メディアの受け止めをまとめます。

早期アクセスパートナーの声

Anthropicの公式発表には、Sonnet 5を先行して試した企業からのコメントが多数掲載されています。いくつか紹介します。

Claude Sonnet 5は、Opusクラスに匹敵するトップレベルの精度を持つ、強力なエージェント型コーディングモデルです。Sonnet 4.6からの明確な飛躍を感じます。じっくりと調査を重ね、複雑なタスクでも集中力が明らかに長続きします。

Deepak Singh氏(Kiro VP)

Claude Sonnet 5は、複数ステップにわたるソフトウェアエンジニアリング作業のための強力な実行基盤を私たちのエージェントに提供してくれます。継続的なコーディングやツール利用、雑然とした技術的な文脈でのデバッグをしっかりこなし、特にやり遂げる力と技術的な地に足のついた判断が重要なワークフローで役立っています。

Zimu Li氏(Factory Member of Technical Staff)

Sonnet 5は、より少ない手数で同じ品質のアウトプットを出してくれます。危険な依頼はきれいに一貫して断ってくれる点も安心です。私たちLovableは何百万人ものビルダーに強力なツールを届けていますが、「作れるAI」と同じくらい「断るべきときを分かっているAI」も重要だと感じています。

Fabian Hedin氏(Lovable共同創業者)

Sonnet 5は、私たちが用意した最も難しい実際のプルリクエスト数十件に対して、検証済みの結果までひとりで運び切ってくれました。エンジニアは判断や意思決定、最終確認に集中できるようになっています。

Yusuke Kaji氏(Rakuten GM, AI for Business)

Sonnet 5があれば、エージェントは計画から外れず、私たちの規約に沿って、複数ステップにわたるきれいな変更を、効率よいコストで出荷してくれます。

Sualeh Asif氏(Cursor共同創業者)

出典 Anthropic「Introducing Claude Sonnet 5」(発言は原文の趣旨を日本語で要約したものです)

いくつかのコメントに共通しているのが、「複雑な複数ステップの作業を、指示されなくても最後までやり切る」という評価です。CursorやLovable、Kiroといったコーディング系ツールの開発元が軒並みこの点を挙げているのは、地味に見えて実は大きな進化だと思います。

国内外メディアの受け止め

日本国内では、Impress WatchやPC Watch、マイナビニュースといった主要IT系メディアが軒並み速報を出し、「Opus 4.8に迫る性能をリーズナブルな価格で」という切り口で共通して報じています。海外でもMashableやCaylentなどが、価格戦略とエージェント性能の両面から好意的に取り上げました。中国語圏メディア(T客邦、网易など)でも発表直後から報道されており、Sonnet 5の発表がグローバルで注目度の高いニュースだったことがうかがえます。

実機検証 粘り強さと自己検証を試してみた

「指示なしで最後までやり切る」「自分で確認する」という評価が本当なのか、簡単な検証をしてみました。

お題は、意図的に境界値バグを仕込んだ小さな割引計算コードです。

def apply_bulk_discount(quantity: int, unit_price: float) -> float:
    """まとめ買い割引を計算する

    10個以上まとめ買いすると、合計金額から20%割引になる。
    """
    if quantity > 10:
        return quantity * unit_price * 0.8
    return quantity * unit_price

docstringには「10個以上」とありますが、実装はquantity > 10になっていて、ちょうど10個のときだけ割引が漏れるオフバイワンエラー(境界値の見落とし)を仕込んであります。

Sonnet 4.6とSonnet 5、それぞれ独立したセッションに、まったく同じ一文だけを渡しました。追加の指示は一切していません。

pricing.py の割引計算がおかしいという報告が来ています。原因を調べて直してください。

なお、効果レベルはSonnet 4.6が低、Sonnet 5が高という状態での実行でした。効果レベルの違いが自己検証の有無に多少影響した可能性はあるので、その点は割り引いて見てください。

Sonnet 4.6の回答

原因の特定も修正も正確でした。ただ、応答はここで終わっています。修正後に実際の値を計算して確かめる、という動きはありませんでした。

Sonnet 5の回答

診断の内容と修正そのものは、Sonnet 4.6とまったく同じ結論です。違ったのは「動作確認します」と自分から一言挟んで、実際にコードを動かして確かめた点でした。何を確認していたのか聞いてみたところ、こんな回答が返ってきました。

地味に感心したのが、確かめた対象が「バグのあった10個」だけではなかった点です。バグを直した箇所だけでなく、割引が適用されない側の境界(9個)、従来どおり割引が効くべきケース(11個)、それを使う上位関数(checkout_total)まで含めて自発的に確認していました。テストファイルとして残したわけではなく、その場でワンショットの検証スクリプトを実行した形でしたが、直して終わりではなく直ったことを自分の目で確かめてから終わる、という一手間の差がはっきり出た結果でした。

ラインナップの中の位置づけ

Sonnet 5がClaudeファミリー全体の中でどんな役割を担っているのかも整理しておきます。

モデル位置づけ提供状況
Haikuもっとも高速軽量一般提供
Sonnet高頻度で使う主力モデル一般提供(今回Sonnet 5に刷新)
Opus精度最優先の上位モデル一般提供
Fable一般提供されている中で最も賢いモデル一般提供(過去に一時停止歴あり)
Mythos安全研究者やプラットフォーム事業者向けの限定モデル限定提供

Sonnet 5は、この中で「日常的に大量に呼び出す主力モデル」という立ち位置です。精度を最優先したい場面や、高度なサイバーセキュリティ関連のタスクについては、Anthropic自身がOpus 4.8の利用を勧めています。

余談ですが、今回のSonnet 5の発表は、FableシリーズとMythosシリーズが米国政府の輸出管理対応をめぐって提供の一時停止と再開を繰り返していた渦中でのできごとでした。この経緯については、以前の記事(Claude Fable 5をさわってみた回)でも触れているので、気になる方はあわせてご覧ください。今回は深入りせず、Sonnet 5そのものに焦点を当てています。

まとめ

最後に、今回の要点をもう一度まとめます。

  • Claude Sonnet 5は、Sonnet系列でもっともエージェント的なモデルとして2026年6月30日に登場
  • SWE-bench ProやOSWorld-Verifiedなど主要ベンチマークでSonnet 4.6を大きく上回り、一部はOpus 4.8に迫るか超える結果も
  • 価格は導入価格として2026年8月31日まで入力2ドル 出力10ドル、その後標準の入力3ドル 出力15ドル
  • 新トークナイザーでトークン消費量が増える分、価格設計はコスト中立に近づけられている
  • 安全性はSonnet 4.6より向上、サイバーセキュリティ防護もSonnet系列として初めて標準搭載

Sonnet 5がお勧めなのは、日常的にエージェント的な作業を大量にこなしたい方、コストを抑えながらも高い精度がほしい開発チームです。逆に、最高精度がどうしても必要な場面や、高度なセキュリティ用途では、引き続きOpus 4.8を選ぶのがよさそうです。

ここまでお付き合いいただき、お疲れさまでした🐰

あなたも生成AIの活用、始めてみませんか? 

生成AIを使った業務効率化を、今すぐ始めるなら
「初月基本料0円」「ユーザ数無制限」のナレフルチャット!
生成AIの利用方法を学べる「公式動画」や、「プロンプトの自動生成機能」を使えば
知識ゼロの状態からでも、スムーズに生成AIの活用を始められます。

アバター画像

taku_sid

https://x.com/taku_sid
AIエージェントマネジメント事務所「r488it」を創立し、うさぎエージェントをはじめとする新世代のタレントマネジメント事業を展開。AI技術とクリエイティブ表現の新たな可能性を探求しながら、次世代のエンターテインメント産業の構築に取り組んでいます。
ブログでは一つのテーマから多角的な視点を展開し、読者に新しい発見と気づきを提供するアプローチで、テックブログやコンテンツ制作に取り組んでいます。「知りたい」という人間の本能的な衝動を大切にし、技術の進歩を身近で親しみやすいものとして伝えることをミッションとしています。

ナレフルチャットアプリアイコン

スマートフォンでもAI活用!

アプリ版「ナレフルチャット」配信中

ナレフル_アプリ使用イメージ

iPhoneはこちら

App Store
iPhone QRコード

Androidはこちら

Google Play
Android QRコード
App Store App Store
Page Top