「ささやかだが目に見える改善」

「ささやかだが目に見える改善」


クロード作品 4.8: 「ささやかだが目に見える改善」

2026 年 5 月 28 日

Anthropic は本日、Claude Opus 4.8 を出荷しました。私が気に入っているのは、リリースのお知らせにあるこのメモです。

ユーザーは、Opus 4.8 が前バージョンからの控えめではあるが目に見える改善であることに気づくでしょう。やるべきことはまだたくさんあります。私たちは、Opus と同じ機能の多くを低コストで提供するモデルの開発とリリースに取り組んでいます。

AI ラボが、リリースを以前のモデルに対する小さな段階的な改善として正直に説明しているのを見るのは、とても新鮮です。

正直さがテーマのようです。その発表の中で私が気に入ったもう 1 つのメモは次のとおりです。

Opus 4.8 の最も顕著な改善点の 1 つは、 正直。私たちはすべてのモデルを正直になるようにトレーニングします。たとえば、サポートできない主張を避けるようにします。しかし、AI モデルの一般的な問題は、証拠が薄いにもかかわらず、自信を持って自分の研究が進歩したと主張して、結論を急ぐことがあることです。初期のテスターは、Opus 4.8 はその動作に関する不確実性を警告する可能性が高く、裏付けのない主張を行う可能性が低いと報告しています。これは私たちの評価でも裏付けられており、Opus 4.8 は、以前のバージョンに比べて、記述されたコードの欠陥が無視される可能性が約 4 倍低いことが示されています。

リンクされたシステム カードには次のものが含まれます。

クロード オーパス 4.8 は、事実上の幻覚の最も直接的な尺度であるすべてのベンチマークにおいて、6 つのモデルの中で最も誤率が低かった。これは主に、より多くの質問に正しく答えることではなく、不確実な質問を控えることによって達成されました。

モデルの特性

4.7 から大きな変更はありません。

価格は Opus 4.5/4.6/4.7 と同じで、入力 100 万件あたり 5 ドル、出力 100 万件あたり 25 ドルです。 「高速モード」の価格はその 2 倍で、以前のモデルから大幅に値下げされています。4.6/4.7 の高速モードは 30 ドル/150 ドルのままです。高速モードは、リサーチ プレビュー「アクセスをリクエストするにはアカウント マネージャーに連絡してください」に参加している組織でのみ利用できることに注意してください。

信頼できる知識のカットオフとトレーニング データのカットオフはどちらも 4.7 と同じ 2026 年 1 月です。

コンテキスト ウィンドウは依然として 1,000,000 トークンであり、最大出力は 128,000 トークンです。

Claude Opus 4.8 の新機能に関するドキュメントには、さらに興味深い詳細がいくつか記載されています。これらが私の目に留まりました。

会話中のシステムメッセージ。クロード作品 4.8 を受け入れます role: "system" ユーザーが提出した直後のメッセージ messages 配列 (配置規則に従います)。これにより、完全なシステム プロンプトを再表示することなく、長時間実行される会話の後半で更新された指示を追加できるようになり、初期のターンでのプロンプト キャッシュ ヒットが保持され、エージェント ループでの入力コストが削減されます。

Anthropic Python SDK のこのアップデートも参照してください。会話中にシステムのプロンプトを操作できると、非常に強力に聞こえます。これは、会話ごとに 1 つのシステム プロンプトを期待する私自身の LLM ライブラリによって提供される抽象化と互換性がないのではないかと心配していました…しかし、最近の再設計で問題なく処理できることがわかりました。

プロンプトキャッシュの最小値が低い。 Claude Opus 4.8 でキャッシュ可能なプロンプトの最小長は 1,024 トークンであり、Claude Opus 4.7 よりも短くなります。

確認したところ、4.7 の最小値は 4,096 でした。

そしてペリカンも何匹か

これは、5 つの思考レベルすべてで自転車に乗っているペリカンです。 lowmediumhighxhigh、 そして max:

今回は、LLM CLI を使用してログを実行し、ログを Markdown にエクスポートして、その Markdown をレンダリングできる HTML ツールを Claude Opus 4.8 に構築してもらいました。 svg フェンスで囲まれたコード ブロックがページ上に SVG として表示されます。

(その後、Codex の GPT-5.5 xhigh でそのコードを更新して XSS ホールを削除しました。クロードに頼めばきっとそれができたと思いますが、現時点では GPT-5.5 が私のコード セキュリティブランケットです。)

最大のものが明らかに最高でしたが、25 個の入力トークンと 17,167 個の出力トークンが必要となり、合計コストは 43 セントでした。



Source link

Postagens Similares

  • گوگل اے آئی موڈ زیادہ آرگینک لنکس کے ساتھ خود کو زیادہ کثرت سے پیش کرتا ہے۔

    1.3 ملین حوالہ جات کا تجزیہ کرنے والی ایک نئی SE درجہ بندی کی رپورٹ کے مطابق، AI موڈ میں گوگل کا خود حوالہ نو ماہ قبل اس کی سطح سے تین گنا زیادہ ہو گیا ہے۔ گوگل اب تمام AI موڈ حوالہ جات میں سے 17% کا حصہ بنتا ہے، جو یوٹیوب، فیس بک،…

  • Motorola ROKR – Sam Soffes

    Iliyotumwa kwenye Machi 28, 2006 Motorola ROKR ni ya kushangaza! Niliboresha Motorola V180 yangu hadi wiki chache zilizopita na ninaipenda. Ilipata hakiki mbaya ikisema kuwa haikuwa simu ya iTunes ya kweli. Nakubali. Ni simu na iTunes. Hata kama haikuwa na iTunes, bado ni simu tamu. Ninapenda tani zaidi ya RAZR, ingawa hiyo ni simu moja…

  • Izgara Sistemim — Sam Soffes

    Yayınlandığı tarih 4 Haziran 2012 Bugünlerde duyarlı CSS ızgara sistemlerini kullanan pek çok insan var. Twitter’ın Bootstrap’i ve Nathan Smith’in 960 Izgara Sistemi gerçekten popüler olanlardır. Hiçbir zaman grid sistemlerinin hayranı olmadım. Her yerde düzene karşılık gelen sınıflara sahip tonlarca div’in olması yanlış geliyor ve kodunuzun çirkin görünmesine neden oluyor. Her neyse, işleri yapmanın gerçekten…

  • Denna mjukvaruingenjörs EDC-påse är redo för utomhusbruk

    Om denna vardagliga bära “Jag är en mjukvaruingenjör som beger mig till tysta campingplatser när det är möjligt. Jag älskar EDC-utrustning, dåligt… kanske lite för mycket. Det här är en av mina favoritinställningar för en lång dag utomhus. Jag packar den när jag vill ha alla verktyg inom räckhåll.” — Dezdenova, mjukvaruingenjör och utomhusentusiast Vi…

  • Lily Forte canaliza glamour vintage e sofrimento moderno em “The Luckiest”

    Há algo magnético sem esforço em um artista que sabe exatamente como misturar épocas, emoções e estética em um mundo coeso, e Lily Forte faz exatamente isso. Aproveitando a força do rock and roll, a alma dos tons elétricos do blues e a suavidade do indie pop, ela cria um som que parece ao mesmo…

  • 左翼は右翼の説明に「絶滅バースト」理論を採用

    「絶滅バースト」理論は、右翼からの暴力的なレトリックや行為の増加を説明するものとして、左翼のTikTokで広まっている。心理学では、この用語は、その行動に対する典型的な報酬が得られなくなったときに、その行動の頻度と強度が一時的に上昇することを指します。 注目のビデオ この活動の「爆発」には、多くの場合、怒り、憤慨、さらには完全な癇癪が伴います。 では、MAGA は消滅バーストを経験しているのでしょうか? 過去数カ月にわたり、リベラル派と左派はTikTokでMAGA運動からの辛辣さや暴力を絶滅バーストの概念に結びつける動画を投稿してきた。応用行動分析(ABA)(自閉症の子供たちによく行われる非常に批判的な治療法)で人気のある研究者らは、ドナルド・トランプ大統領のファンがなぜそのような傾向にあるのかを説明するためにこのアイデアを応用した。 2024年、TikTokerで政治主催者のマディー・クリフォード(@madlines)は、MAGAの演技を幼児の癇癪に例えた。 「赤ちゃんは、自分の欲求を満たすために泣くのです」と彼女は説明した。 「つまり、人間の発達における重要な段階は、幼児が癇癪を起こすときなのです。」 「その行動の強化を止める必要があるので、子供がそのパターンを破り始める前に、癇癪が起こる期間が存在する可能性があります。」 @madlines Extinction Burst 🤓 #anticapitalism #project2025 #psychologyfacts ♬ オリジナル楽曲 – マディ・クリフォード 基本的に、幼児は泣いても自分の望むものが得られなくなったことに激怒する段階を経ます。彼らは、しばらくの間さらに激しく泣き、叫び、暴言を吐くなどの反応をしますが、最終的にはこの行動では結果が得られないことを受け入れ、優しく尋ねるなど、別のことを試みなければなりません。 2025年9月、@denta5857は、異性愛者でシスジェンダーの白人クリスチャンとして存在するだけでは以前のような見返りが得られず、MAGAが現在同じようなことを経験している可能性があると説明した。彼はそれを2008年のバラク・オバマ前大統領の選挙まで遡る。 @denta5857/TikTok 「サラ・ペイリン、ティーパーティー運動、出産運動、そして最終的にはMAGAは、避けられない絶滅に直面した10年間にわたる怒りの津波だ」と彼は語った。 「これが、共和党がこれほど怒っている理由だ。彼らは知っている!彼らはトランプの勝利がそれを止められないことを知っているし、トランプが大統領に就任してもそれを止められないことを知っている。」 彼は続けて、「彼らは自分たちの恐ろしい信念が必然的に消滅することを感じているのです」と述べた。 左翼は右翼の怒りの中に希望を見出す 右派は政治的暴力は向こうから来ていると主張したがるが、データは嘘をつかない。保守派は常に現状維持に投資し、左翼が主張する進歩や変化に抵抗してきた。状況が必然的に変化する中、右派の政治的暴力は一貫して左派の政治暴力をはるかに上回っている。 ここ数十年は、初の黒人米国大統領の誕生や、LGBTQ+ コミュニティなどのグループの権利と認知の面での躍進など、急激な変化が見られました。 トランプ陣営のレトリックを絶滅の爆発として説明できれば、より良い時代が到来しているはずだ。 @dannylime @trashpanduhs 7/18/2025 チェックしてください。@ああ、それは豊かですね、彼は私たち全員が活用できる豊富な知識を持っています。 #fyp #アメリカ #politicsstiktok #民主党 #共和党 #リベラル #保守党 #ドナルドトランプ ♬ オリジナル楽曲 – ダニー・ライム 🍋‍🟩 「最終的に、こうした人々が立ち上がったり、大声を上げたり、公共の場に現れたりするとき、ある程度の支持は得られますが、彼らは数で圧倒的に劣っていることに気づいています。そして彼らも気づいています」と @dannylime は 7 月に述べた。 「この国を純粋なヨーロッパ人、キリスト教徒、福音派の右翼民族国家に変える戦いはずっと前に敗れた。」…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *