CLAUDE LABEN
AUTO — Claude Managed Agents の権限ポリシーに auto が入りました。サーバーが呼び出しごとに評価し、実行・拒否・承認待ちのいずれかを選びますEVAL — agent.tool_use と agent.mcp_tool_use が evaluation フィールドを持ち、その呼び出しがどう評価されたのかを報告しますCONNECT — ant beta:sessions connect で、走っているセッションに手元のターミナルから入れます。--web を渡すと Console のビューアをローカルで配信しますCOWORK — Cowork は v1.49585.0 でランタイムが Electron 44 へ上がりました。macOS 13 Ventura 以降が必須になっていますLIMIT — 5時間の利用上限に達して保留されたメッセージが、制限のリセット時に自動で送信されるようになりました。編集もキャンセルもできますCONFIG — 管理設定の非推奨フィールドに対する警告が9月10日から出始めました。旧表記の受付は10月7日 正午 太平洋時間までですAUTO — Claude Managed Agents の権限ポリシーに auto が入りました。サーバーが呼び出しごとに評価し、実行・拒否・承認待ちのいずれかを選びますEVAL — agent.tool_use と agent.mcp_tool_use が evaluation フィールドを持ち、その呼び出しがどう評価されたのかを報告しますCONNECT — ant beta:sessions connect で、走っているセッションに手元のターミナルから入れます。--web を渡すと Console のビューアをローカルで配信しますCOWORK — Cowork は v1.49585.0 でランタイムが Electron 44 へ上がりました。macOS 13 Ventura 以降が必須になっていますLIMIT — 5時間の利用上限に達して保留されたメッセージが、制限のリセット時に自動で送信されるようになりました。編集もキャンセルもできますCONFIG — 管理設定の非推奨フィールドに対する警告が9月10日から出始めました。旧表記の受付は10月7日 正午 太平洋時間までです
TAG

evaluation

2 記事
タグ一覧に戻る
関連タグ:
claude-api2prompt-engineering2production2regression-testing1testing1quality-assurance1
API & SDK/2026-05-01上級

Claude API のプロンプトをリグレッションから守る — Golden Dataset で品質を継続検証する仕組み

モデル更新やプロンプトの微修正で出力品質が静かに劣化する問題に、Golden DatasetとLLM-as-a-Judgeで備える実装ガイドです。50件から始める最小構成、Cohen's Kappaによる信頼度担保、評価コストを月50ドル以下に抑える設計、GitHub ActionsへのCI組み込みまで解説します。

API & SDK/2026-03-27上級

Claude API LLM評価パイプライン構築ガイド — Claude-as-Judge・プロンプトA/Bテスト・品質スコアリングの実装パターン

Claude API を使った LLM アプリケーション評価パイプラインの設計と実装。Claude-as-Judge、プロンプト A/B テスト、品質スコアリング、回帰テストの本番実装パターンを扱います。