Extended Thinking を入れたのに精度は横ばい、請求だけ伸びていたとき — 思考トークンの限界効用を計測して budget を決める運用メモ
budget_tokens を大きめに固定したまま、精度が変わらないのに請求だけ伸びていく。思考トークンを台帳に残し、budget を1段上げたときの正解率の伸びを限界効用として計測して、根拠のある値に落とす運用メモです。
Claude API 拡張思考を本番導入して見えたコストの現実 — タスク別の費用対効果と使い分け判断基準
拡張思考(Extended Thinking)を本番環境で3ヶ月運用し、タスク別のコスト・精度・速度を計測した実データを公開します。費用対効果マトリクスによる使い分け判断フロー、モデル選択との組み合わせ、思考トークンが効く場面と不要な場面の見極めまで、実測値に基づいて解説します。
「考えながら調べる」AIエージェントの作り方 — Claude API 拡張思考 × Tool Use 本番実装ガイド
Claude APIの拡張思考(Extended Thinking)とTool Useを組み合わせる実装パターンを詳解。頻出エラーの根本原因、リサーチエージェントの完全実装コード、本番でのコスト・タイムアウト設計まで体系的に解説します。
Gemma 4 の「思考モード」は Claude の拡張思考とどう違うのか
Gemma 4が搭載した4,000トークン超の内部推論「思考モード」を、Claudeの拡張思考と比較しながら解説します。両者の3つの本質的な違い、AIME 89.2%という数学推論スコアの意味、ローカル実装でどちらを選ぶべきかの判断基準、始め方の最初の一歩までまとめました。
Claude Sonnet 4.6 — 1Mトークン・Computer Use・Extended Thinking を本番で使いこなす実装パターン
2026年2月リリースの Claude Sonnet 4.6 を徹底解剖。1Mトークンコンテキスト・Computer Use 72.5点・Extended Thinking の実装から、Opus 4.6 との使い分け・コスト最適化・本番運用パターンまで実装コード付きで完全解説します。
Claude Opus 4.6 拡張思考のプロダクション活用パターン — 複雑な推論を制御する
Claude Opus 4.6の拡張思考をプロダクションで制御するための設計パターン集です。budget_tokensの決め方と動作原理、コスト最適化戦略、ストリーミングとの統合、フォールバックを含むエラーハンドリング、推論チェーン検証、大規模コードレビューへの適用例まで体系的に解説します。
Claude API で PDF 解析・要約アプリを構築する:Vision + Extended Thinking 活用ガイド
契約書やレポートなど大量のPDFを手作業で読む時間を減らすため、Claude APIのVisionとExtended Thinkingを組み合わせた解析・要約アプリを構築します。PDFの画像変換からページ内容の抽出、深い要約の生成、完成版パイプラインまでをPythonのコードとともに段階的に解説します。