CLAUDE LABEN
PRICING — Claude Sonnet 5 の9月1日の値上げは撤回されました。100万トークンあたり入力2ドル・出力10ドルがそのまま標準価格になります。入力3ドル・出力15ドルを前提に組んだ試算は引き直しが必要ですVERSION — v2.1.241(8月23日)は修正と安定性の改善が中心です。長時間ストリームを一定時間で切るサーバーに対して MCP v2 が subscriptions/listen を延々と開き直す問題が直りましたLINUX — サンドボックスを有効にした Linux で、アイドル状態のセッションが CPU コアを1つ 100% のまま占有し続ける問題が修正されましたSKILLS — 同梱スキルのエイリアス(/checkup や /review)が、-p モードやプラグイン・MCP 読み込み時に「Unknown command」になる問題が直りました。同名のユーザースキルが影を作っていた場合の挙動ですARGS — スキルとコマンドの引数置換で、引数の値がテンプレートマーカーとして再展開されてしまう問題が修正されましたWATERMARK — 8月2日以降にリリースされた Claude 製品は、生成物に機械可読なマーキングを含みます。EU AI Act の透明性要件への対応ですが、適用は欧州に限らず全世界ですPRICING — Claude Sonnet 5 の9月1日の値上げは撤回されました。100万トークンあたり入力2ドル・出力10ドルがそのまま標準価格になります。入力3ドル・出力15ドルを前提に組んだ試算は引き直しが必要ですVERSION — v2.1.241(8月23日)は修正と安定性の改善が中心です。長時間ストリームを一定時間で切るサーバーに対して MCP v2 が subscriptions/listen を延々と開き直す問題が直りましたLINUX — サンドボックスを有効にした Linux で、アイドル状態のセッションが CPU コアを1つ 100% のまま占有し続ける問題が修正されましたSKILLS — 同梱スキルのエイリアス(/checkup や /review)が、-p モードやプラグイン・MCP 読み込み時に「Unknown command」になる問題が直りました。同名のユーザースキルが影を作っていた場合の挙動ですARGS — スキルとコマンドの引数置換で、引数の値がテンプレートマーカーとして再展開されてしまう問題が修正されましたWATERMARK — 8月2日以降にリリースされた Claude 製品は、生成物に機械可読なマーキングを含みます。EU AI Act の透明性要件への対応ですが、適用は欧州に限らず全世界です
TAG

Evaluation

2 記事
タグ一覧に戻る
関連タグ:
claude-api2prompt-engineering2production2regression-testing1testing1quality-assurance1
API & SDK/2026-05-01上級

Claude API のプロンプトをリグレッションから守る — Golden Dataset で品質を継続検証する仕組み

モデル更新やプロンプトの微修正で出力品質が静かに劣化する問題に、Golden DatasetとLLM-as-a-Judgeで備える実装ガイドです。50件から始める最小構成、Cohen's Kappaによる信頼度担保、評価コストを月50ドル以下に抑える設計、GitHub ActionsへのCI組み込みまで解説します。

API & SDK/2026-03-27上級

Claude API LLM評価パイプライン構築ガイド — Claude-as-Judge・プロンプトA/Bテスト・品質スコアリングの実装パターン

Claude API を使った LLM アプリケーション評価パイプラインの設計と実装。Claude-as-Judge、プロンプト A/B テスト、品質スコアリング、回帰テストの本番実装パターンを扱います。