「ささやかだが目に見える改善」
クロード作品 4.8: 「ささやかだが目に見える改善」
2026 年 5 月 28 日
Anthropic は本日、Claude Opus 4.8 を出荷しました。私が気に入っているのは、リリースのお知らせにあるこのメモです。
ユーザーは、Opus 4.8 が前バージョンからの控えめではあるが目に見える改善であることに気づくでしょう。やるべきことはまだたくさんあります。私たちは、Opus と同じ機能の多くを低コストで提供するモデルの開発とリリースに取り組んでいます。
AI ラボが、リリースを以前のモデルに対する小さな段階的な改善として正直に説明しているのを見るのは、とても新鮮です。
正直さがテーマのようです。その発表の中で私が気に入ったもう 1 つのメモは次のとおりです。
Opus 4.8 の最も顕著な改善点の 1 つは、 正直。私たちはすべてのモデルを正直になるようにトレーニングします。たとえば、サポートできない主張を避けるようにします。しかし、AI モデルの一般的な問題は、証拠が薄いにもかかわらず、自信を持って自分の研究が進歩したと主張して、結論を急ぐことがあることです。初期のテスターは、Opus 4.8 はその動作に関する不確実性を警告する可能性が高く、裏付けのない主張を行う可能性が低いと報告しています。これは私たちの評価でも裏付けられており、Opus 4.8 は、以前のバージョンに比べて、記述されたコードの欠陥が無視される可能性が約 4 倍低いことが示されています。
リンクされたシステム カードには次のものが含まれます。
クロード オーパス 4.8 は、事実上の幻覚の最も直接的な尺度であるすべてのベンチマークにおいて、6 つのモデルの中で最も誤率が低かった。これは主に、より多くの質問に正しく答えることではなく、不確実な質問を控えることによって達成されました。
モデルの特性
4.7 から大きな変更はありません。
価格は Opus 4.5/4.6/4.7 と同じで、入力 100 万件あたり 5 ドル、出力 100 万件あたり 25 ドルです。 「高速モード」の価格はその 2 倍で、以前のモデルから大幅に値下げされています。4.6/4.7 の高速モードは 30 ドル/150 ドルのままです。高速モードは、リサーチ プレビュー「アクセスをリクエストするにはアカウント マネージャーに連絡してください」に参加している組織でのみ利用できることに注意してください。
信頼できる知識のカットオフとトレーニング データのカットオフはどちらも 4.7 と同じ 2026 年 1 月です。
コンテキスト ウィンドウは依然として 1,000,000 トークンであり、最大出力は 128,000 トークンです。
Claude Opus 4.8 の新機能に関するドキュメントには、さらに興味深い詳細がいくつか記載されています。これらが私の目に留まりました。
会話中のシステムメッセージ。クロード作品 4.8 を受け入れます
role: "system"ユーザーが提出した直後のメッセージmessages配列 (配置規則に従います)。これにより、完全なシステム プロンプトを再表示することなく、長時間実行される会話の後半で更新された指示を追加できるようになり、初期のターンでのプロンプト キャッシュ ヒットが保持され、エージェント ループでの入力コストが削減されます。
Anthropic Python SDK のこのアップデートも参照してください。会話中にシステムのプロンプトを操作できると、非常に強力に聞こえます。これは、会話ごとに 1 つのシステム プロンプトを期待する私自身の LLM ライブラリによって提供される抽象化と互換性がないのではないかと心配していました…しかし、最近の再設計で問題なく処理できることがわかりました。
プロンプトキャッシュの最小値が低い。 Claude Opus 4.8 でキャッシュ可能なプロンプトの最小長は 1,024 トークンであり、Claude Opus 4.7 よりも短くなります。
確認したところ、4.7 の最小値は 4,096 でした。
そしてペリカンも何匹か
これは、5 つの思考レベルすべてで自転車に乗っているペリカンです。 low、 medium、 high、 xhigh、 そして max:
今回は、LLM CLI を使用してログを実行し、ログを Markdown にエクスポートして、その Markdown をレンダリングできる HTML ツールを Claude Opus 4.8 に構築してもらいました。 svg フェンスで囲まれたコード ブロックがページ上に SVG として表示されます。
(その後、Codex の GPT-5.5 xhigh でそのコードを更新して XSS ホールを削除しました。クロードに頼めばきっとそれができたと思いますが、現時点では GPT-5.5 が私のコード セキュリティブランケットです。)
最大のものが明らかに最高でしたが、25 個の入力トークンと 17,167 個の出力トークンが必要となり、合計コストは 43 セントでした。
