CLAUDE LABEN
MODEL — Claude Fable 5.1 と Claude Mythos 5.1 が9月1日に公開されました。両者は同一のモデルで、違うのは安全装置の強度だけという設計ですPRICING — トークン単価の $10/$50 per MTok は据え置きで、下がったのはキャッシュ読み取りだけです。75% 引き下げられて $0.25 per MTok になりましたCOST — 効き方は使い方次第です。典型ワークロードで約25%減、コンテキストとツールの重い作業では最大約45%減。自分の内訳を測らずに一律25%と書くと外れますBENCH — Terminal-Bench-Science 0.1 が Fable 5 の 24.7% から 52.6% へ。ただし公式が標準誤差 ±3.5〜4.5 ポイントと明記しているので、小さな差の扱いには注意が要りますSAFEGUARDS — サイバー安全装置が精密になり、Claude Code のセッションあたり介入が平均で約60%減りました。脆弱性の発見は可能、エクスプロイトの開発は引き続き不可ですAPI — 本日以降に作られた新規 API アカウントでは、思考トランスクリプトを保ったままの過去コンテキスト編集ができなくなりました。蒸留対策で、既存アカウントは当面対象外ですMODEL — Claude Fable 5.1 と Claude Mythos 5.1 が9月1日に公開されました。両者は同一のモデルで、違うのは安全装置の強度だけという設計ですPRICING — トークン単価の $10/$50 per MTok は据え置きで、下がったのはキャッシュ読み取りだけです。75% 引き下げられて $0.25 per MTok になりましたCOST — 効き方は使い方次第です。典型ワークロードで約25%減、コンテキストとツールの重い作業では最大約45%減。自分の内訳を測らずに一律25%と書くと外れますBENCH — Terminal-Bench-Science 0.1 が Fable 5 の 24.7% から 52.6% へ。ただし公式が標準誤差 ±3.5〜4.5 ポイントと明記しているので、小さな差の扱いには注意が要りますSAFEGUARDS — サイバー安全装置が精密になり、Claude Code のセッションあたり介入が平均で約60%減りました。脆弱性の発見は可能、エクスプロイトの開発は引き続き不可ですAPI — 本日以降に作られた新規 API アカウントでは、思考トランスクリプトを保ったままの過去コンテキスト編集ができなくなりました。蒸留対策で、既存アカウントは当面対象外です
TAG

Agent

11 記事
タグ一覧に戻る
関連タグ:
claude-api6tool-use4production3typescript2api2regression-testing1observability1context-editing1context-management1prompt-caching1cost-optimization1claude-code1
API & SDK/2026-07-09上級

出力は同じ、道筋は違う — エージェントの軌跡を不変条件で守る

既定モデルが入れ替わっても最終出力は正しいまま、ツール呼び出しの道筋だけが静かに変わることがあります。実行トレースを記録し、不変条件で機械的にアサートする軌跡回帰ハーネスを実装コードと実測値で整理しました。

API & SDK/2026-06-29上級

Claude API の Context Editing を入れたらエージェントが同じ調査を繰り返したとき — クリア境界とキャッシュ無効化を計測する運用メモ

Context Editing でツール結果を自動クリアしたら、エージェントが直前に読んだ内容を忘れて同じツールを呼び直し、キャッシュも毎回壊れてコストが上がった。沈黙する劣化を計測ログで切り分け、trigger・keep・clear_at_least を実測で決める運用メモです。

Claude Code/2026-06-25上級

応答が返らないMCP呼び出しに、無人の定期実行が丸ごと飲み込まれた日 — 自前のデッドラインで止め時を握る

リモートMCPツール呼び出しが応答なしで止まると、無人の定期実行はそのまま待ち続けます。プラットフォーム側の打ち切りに任せきりにせず、自前のデッドラインとサーキットブレーカで止め時を握る設計を、実装込みで整理しました。

API & SDK/2026-06-20上級

effort パラメータを工程ごとに振り分けて Claude の出力コストと待ち時間を整える

Claude API の effort パラメータは思考・本文・ツール呼び出しを含む出力トークン全体を制御します。一律 high をやめ、工程ごとに段階配分する実装と動的ルーターを、個人開発の自動運用での実測とともに解説します。

API & SDK/2026-06-19上級

Claude × Playwright のブラウザエージェントが「成功したつもり」で失敗するとき — 操作を検証し UI の変化に先回りする実装メモ

Claude API と Playwright のブラウザエージェントは、視覚で判断する分だけ「やったつもりで失敗する」誤成功が起きます。自己申告を信じず操作を事後検証する設計と、UI 変化に先回りで気づくドリフト検知の実装をまとめます。

API & SDK/2026-05-05上級

「考えながら調べる」AIエージェントの作り方 — Claude API 拡張思考 × Tool Use 本番実装ガイド

Claude APIの拡張思考(Extended Thinking)とTool Useを組み合わせる実装パターンを詳解。頻出エラーの根本原因、リサーチエージェントの完全実装コード、本番でのコスト・タイムアウト設計まで体系的に解説します。

API & SDK/2026-04-21上級

エージェントに「承認ゲート」を差し込む — Claude API で Human-in-the-loop を本番運用する設計

自律エージェントの一部の判断だけを人間に委ねる承認ゲートを、Claude APIで本番に組み込む設計です。ゲートを入れる5つの場所、メッセージ履歴を保存した中断と再開、Slackやメールでの非同期通知、承認待ちの期限切れの扱い、監査ログに耐える構成まで動くコード付きで解説します。

API & SDK/2026-04-09中級

Claude Managed Agents — 2026年4月リリースの次世代AIエージェント基盤

2026年4月8日にパブリックベータ開始したClaude Managed Agentsの全貌を解説。サンドボックス実行・認証・チェックポイントなど主要機能から実装手順・料金まで、プロダクション対応AIエージェント開発の新しい標準を徹底紹介します。

Claude AI/2026-04-04上級

Claude で構築するリアルタイム市場調査エージェント — 競合分析・価格監視・トレンド検出を完全自動化

ClaudeのWeb検索・構造化出力・ツール呼び出しを組み合わせて、市場調査を自動化するエージェントを構築します。競合分析・価格監視・トレンド検出という3つのエージェントの実装をステップごとに示し、アーキテクチャの考え方から具体的なコードまでを詳しく解説します。

API & SDK/2026-03-31上級

Claude API で自己修復型AIエージェントを構築する — エラー検出・自動リカバリ・グレースフルデグラデーションの本番実装パターン

障害を自動検出して自己修復する本番向けAIエージェントをClaude APIで構築します。エラーの7分類と最適なリカバリ戦略、指数バックオフ付きリトライ、コンテキスト圧縮による自動回復、Supervisorパターンでのマルチエージェント修復、ツール呼び出しのフォールバックチェーンまで実装します。

API & SDK/2026-03-25上級

Claude API リアルタイムマルチモーダルエージェント構築ガイド

Vision + Tool Useを統合したリアルタイムマルチモーダルエージェントの構築方法を実装レベルで解説。ストリーミングマルチモーダルパイプライン、本番環境でのエラーハンドリング、コスト最適化パターンを含む。