CLAUDE LABEN
2.1.269 — Claude Code の最新版は98件の CLI 変更を含む大きめの版です。目玉は claude plugin eval で、プラグインの効きを採点できるようになりましたEVAL — 各ケースはプラグインあり3回・なし3回で走ります。出てくるのは成否ではなく、そのプラグインが何を足したのかという差ですGRADER — 採点器は3種類。返答への正規表現、特定のツールが呼ばれたか、そして別のモデルに判定させるルーブリックから選べますDIFF — Bash ツールの結果に、そのコマンドが変更したファイルの差分が付くようになりました。設定は bashEditDiffEnabled ですSTYLE — /output-style [name] で出力スタイルを切り替えられます。Remote Control 経由でも、クラウドや headless セッションでも使えますOTEL — OTEL_METRICS_INCLUDE_REPOSITORY でメトリクスに vcs. のリポジトリ属性が付きます。commit イベントには vcs.ref.head が入ります2.1.269 — Claude Code の最新版は98件の CLI 変更を含む大きめの版です。目玉は claude plugin eval で、プラグインの効きを採点できるようになりましたEVAL — 各ケースはプラグインあり3回・なし3回で走ります。出てくるのは成否ではなく、そのプラグインが何を足したのかという差ですGRADER — 採点器は3種類。返答への正規表現、特定のツールが呼ばれたか、そして別のモデルに判定させるルーブリックから選べますDIFF — Bash ツールの結果に、そのコマンドが変更したファイルの差分が付くようになりました。設定は bashEditDiffEnabled ですSTYLE — /output-style [name] で出力スタイルを切り替えられます。Remote Control 経由でも、クラウドや headless セッションでも使えますOTEL — OTEL_METRICS_INCLUDE_REPOSITORY でメトリクスに vcs. のリポジトリ属性が付きます。commit イベントには vcs.ref.head が入ります
TAG

extended-thinking

7 記事
タグ一覧に戻る
関連タグ:
claude-api3claude2cost-optimization2api-sdk2python2reasoning2production2budget-tokens1observability1コスト最適化1本番運用1tool-use1
API & SDK/2026-07-13上級

Extended Thinking を入れたのに精度は横ばい、請求だけ伸びていたとき — 思考トークンの限界効用を計測して budget を決める運用メモ

budget_tokens を大きめに固定したまま、精度が変わらないのに請求だけ伸びていく。思考トークンを台帳に残し、budget を1段上げたときの正解率の伸びを限界効用として計測して、根拠のある値に落とす運用メモです。

API & SDK/2026-05-05上級

Claude API 拡張思考を本番導入して見えたコストの現実 — タスク別の費用対効果と使い分け判断基準

拡張思考(Extended Thinking)を本番環境で3ヶ月運用し、タスク別のコスト・精度・速度を計測した実データを公開します。費用対効果マトリクスによる使い分け判断フロー、モデル選択との組み合わせ、思考トークンが効く場面と不要な場面の見極めまで、実測値に基づいて解説します。

API & SDK/2026-05-05上級

「考えながら調べる」AIエージェントの作り方 — Claude API 拡張思考 × Tool Use 本番実装ガイド

Claude APIの拡張思考(Extended Thinking)とTool Useを組み合わせる実装パターンを詳解。頻出エラーの根本原因、リサーチエージェントの完全実装コード、本番でのコスト・タイムアウト設計まで体系的に解説します。

Claude AI/2026-04-14中級

Gemma 4 の「思考モード」は Claude の拡張思考とどう違うのか

Gemma 4が搭載した4,000トークン超の内部推論「思考モード」を、Claudeの拡張思考と比較しながら解説します。両者の3つの本質的な違い、AIME 89.2%という数学推論スコアの意味、ローカル実装でどちらを選ぶべきかの判断基準、始め方の最初の一歩までまとめました。

Claude AI/2026-04-03中級

Claude Sonnet 4.6 — 1Mトークン・Computer Use・Extended Thinking を本番で使いこなす実装パターン

2026年2月リリースの Claude Sonnet 4.6 を徹底解剖。1Mトークンコンテキスト・Computer Use 72.5点・Extended Thinking の実装から、Opus 4.6 との使い分け・コスト最適化・本番運用パターンまで実装コード付きで完全解説します。

API & SDK/2026-03-30上級

Claude Opus 4.6 拡張思考のプロダクション活用パターン — 複雑な推論を制御する

Claude Opus 4.6の拡張思考をプロダクションで制御するための設計パターン集です。budget_tokensの決め方と動作原理、コスト最適化戦略、ストリーミングとの統合、フォールバックを含むエラーハンドリング、推論チェーン検証、大規模コードレビューへの適用例まで体系的に解説します。

API & SDK/2026-03-26中級

Claude API で PDF 解析・要約アプリを構築する:Vision + Extended Thinking 活用ガイド

契約書やレポートなど大量のPDFを手作業で読む時間を減らすため、Claude APIのVisionとExtended Thinkingを組み合わせた解析・要約アプリを構築します。PDFの画像変換からページ内容の抽出、深い要約の生成、完成版パイプラインまでをPythonのコードとともに段階的に解説します。