CLAUDE LABEN
MODEL — Claude Fable 5.1 と Claude Mythos 5.1 が9月1日に公開されました。両者は同一のモデルで、違うのは安全装置の強度だけという設計ですPRICING — トークン単価の $10/$50 per MTok は据え置きで、下がったのはキャッシュ読み取りだけです。75% 引き下げられて $0.25 per MTok になりましたCOST — 効き方は使い方次第です。典型ワークロードで約25%減、コンテキストとツールの重い作業では最大約45%減。自分の内訳を測らずに一律25%と書くと外れますBENCH — Terminal-Bench-Science 0.1 が Fable 5 の 24.7% から 52.6% へ。ただし公式が標準誤差 ±3.5〜4.5 ポイントと明記しているので、小さな差の扱いには注意が要りますSAFEGUARDS — サイバー安全装置が精密になり、Claude Code のセッションあたり介入が平均で約60%減りました。脆弱性の発見は可能、エクスプロイトの開発は引き続き不可ですAPI — 本日以降に作られた新規 API アカウントでは、思考トランスクリプトを保ったままの過去コンテキスト編集ができなくなりました。蒸留対策で、既存アカウントは当面対象外ですMODEL — Claude Fable 5.1 と Claude Mythos 5.1 が9月1日に公開されました。両者は同一のモデルで、違うのは安全装置の強度だけという設計ですPRICING — トークン単価の $10/$50 per MTok は据え置きで、下がったのはキャッシュ読み取りだけです。75% 引き下げられて $0.25 per MTok になりましたCOST — 効き方は使い方次第です。典型ワークロードで約25%減、コンテキストとツールの重い作業では最大約45%減。自分の内訳を測らずに一律25%と書くと外れますBENCH — Terminal-Bench-Science 0.1 が Fable 5 の 24.7% から 52.6% へ。ただし公式が標準誤差 ±3.5〜4.5 ポイントと明記しているので、小さな差の扱いには注意が要りますSAFEGUARDS — サイバー安全装置が精密になり、Claude Code のセッションあたり介入が平均で約60%減りました。脆弱性の発見は可能、エクスプロイトの開発は引き続き不可ですAPI — 本日以降に作られた新規 API アカウントでは、思考トランスクリプトを保ったままの過去コンテキスト編集ができなくなりました。蒸留対策で、既存アカウントは当面対象外です
TAG

prompt-engineering

7 記事
タグ一覧に戻る
関連タグ:
production4claude-api2evaluation2claude-ai2regression-testing1claude-code1workflow1verification1debugging1ops1ab-test1versioning1
API & SDK/2026-05-01上級

Claude API のプロンプトをリグレッションから守る — Golden Dataset で品質を継続検証する仕組み

モデル更新やプロンプトの微修正で出力品質が静かに劣化する問題に、Golden DatasetとLLM-as-a-Judgeで備える実装ガイドです。50件から始める最小構成、Cohen's Kappaによる信頼度担保、評価コストを月50ドル以下に抑える設計、GitHub ActionsへのCI組み込みまで解説します。

Claude Code/2026-04-29中級

Claude Code が途中でタスクを諦める問題 — 完走させるプロンプト設計と検証ループ

「完了しました」と言いながら実は半分しか終わっていないClaude Codeを完走させる方法です。途中で完了と判断してしまう理由の分析、完了条件を明示するプロンプトの3要素、自動検証ループの実装パターン、Hooksとの組み合わせ、実際に使っているテンプレートまで公開します。

Claude AI/2026-04-29上級

Claude AI を本番運用の「デバッグ相棒」にする — ログ要約・原因仮説・再現コードを作らせる実践設計

個人開発者が深夜のアラートに一人で立ち向かう現実を踏まえ、Claudeをデバッグの相棒として本番運用するための具体的な設計図を、3つのプロンプト・前処理パイプライン・落とし穴の回避策まで通しで解説します。

API & SDK/2026-04-28上級

Claude API のプロンプトをコードとして管理する — レジストリ・バージョニング・A/Bテストの本番運用ガイド

Claude API を本番運用していると必ず直面する「どの prompt が、いつ、誰に、どの version で配信されたか」を解決するためのレジストリ設計と、A/Bテスト・段階的ロールアウト・自動ロールバックまでを実装レベルで解説します。

API & SDK/2026-03-27上級

Claude API LLM評価パイプライン構築ガイド — Claude-as-Judge・プロンプトA/Bテスト・品質スコアリングの実装パターン

Claude API を使った LLM アプリケーション評価パイプラインの設計と実装。Claude-as-Judge、プロンプト A/B テスト、品質スコアリング、回帰テストの本番実装パターンを扱います。

Claude AI/2026-03-26初級

Claude AI で文章を効率的に要約する方法 — プロンプト設計から API 活用まで

Claude AI を使った文章要約のテクニックを網羅的に解説。基本的なプロンプト設計から、PDF・議事録・論文の要約、Python/TypeScript での API 実装まで、実践的な手法を紹介します。

Claude AI/2026-03-26中級

Claude System Prompts 設計パターン集 — プロが実践する7つのテンプレート

Claudeのシステムプロンプト設計で出力品質を高める7つの実践パターンを紹介します。ロール定義と制約条件の分離、Chain-of-Thoughtを誘導する段階的思考の強制、Few-Shotによる出力形式の固定など、業務で使えるテンプレートをコード例とともに解説します。