CLAUDE LABEN
MEMORY — Claude Codeの長時間セッションのメモリリークが一掃されました。MCP stdioサーバのstderrが最大64MB蓄積する問題やLSPドキュメントの開きっぱなしが修正されていますTABLES — 非常に大きなmarkdownテーブルが描画を止める不具合を修正。200行を超えるテーブルは先頭200行と「… N more rows」表示になりますSPEED — deny/askルールを多く抱えたセッションで毎ターン数秒遅くなる問題を修正。ルールマッチャがコンパイルして再利用されますTOOLS — MCPツールが多いprint/SDKセッションでは、ツールプールの組み立てをキャッシュし最大7倍速いラウンドになりましたARTIFACTS — Claude CodeのArtifactsは、セッションの作業をその場で更新される共有Webページに変えます。PR解説やダッシュボードに使えますDEADLINE — 7月24日にOpus 4.7のfastモードが削除されます。speed: "fast" はエラーになるため、Opus 4.8のfastモードへ移行が必要ですMEMORY — Claude Codeの長時間セッションのメモリリークが一掃されました。MCP stdioサーバのstderrが最大64MB蓄積する問題やLSPドキュメントの開きっぱなしが修正されていますTABLES — 非常に大きなmarkdownテーブルが描画を止める不具合を修正。200行を超えるテーブルは先頭200行と「… N more rows」表示になりますSPEED — deny/askルールを多く抱えたセッションで毎ターン数秒遅くなる問題を修正。ルールマッチャがコンパイルして再利用されますTOOLS — MCPツールが多いprint/SDKセッションでは、ツールプールの組み立てをキャッシュし最大7倍速いラウンドになりましたARTIFACTS — Claude CodeのArtifactsは、セッションの作業をその場で更新される共有Webページに変えます。PR解説やダッシュボードに使えますDEADLINE — 7月24日にOpus 4.7のfastモードが削除されます。speed: "fast" はエラーになるため、Opus 4.8のfastモードへ移行が必要です
記事一覧/API & SDK
API & SDK/2026-06-13中級

「続きを書いてください」をやめる — Claude Fable 5 の 128k 出力で長文レポート生成を一括化した実装記録

数万字の月次レポートを生成するたび、出力上限で切れて「続きから」と投げ直していた運用を、Claude Fable 5 の 128k 出力で一括化しました。ストリーミングで受け切る実装、切断からの再開設計、分割生成との費用比較を実測ベースで残します。

claude-fable-52128k出力ストリーミング9長文生成3コスト最適化25

プレミアム記事

毎月の月初に、個人開発で運用しているアプリ4本ぶんの月次運用レポートを Claude API で生成しています。クラッシュの傾向、ストアレビューへの返信記録、AdMob の収益変動。ひと月分を一つのドキュメントに整形すると、日本語で4万字近くになります。

この長さになると、悩みの種は出力上限との付き合い方でした。生成が途中で切れるたびに「ここまでの続きから書いてください」と投げ直し、つなぎ目を読み直して整える。見出しのレベルがずれていたり、同じ注意書きが二度現れたり、後半だけ文体が少し変わっていたり。この継ぎ作業に、毎月20分ほど取られていました。

6月9日に公開された Claude Fable 5 は、最大 128,000 トークンの出力に対応しています。6月22日までは主要プランに追加費用なしで同梱されているため、試すなら今のうちだと考え、この月次レポート生成を「一括出力」に置き換えてみました。結論から言うと、継ぎ目の手直しはゼロになり、費用も分割方式より約26%下がりました。ただし、ストリーミング前提の実装と、いくつかの落とし穴への備えが必要です。本文ではその実装と実測値を順に残します。

分割生成で実際に起きていたこと

最初に、置き換える前の運用を正直に書いておきます。これまでは max_tokens を 16,384 に設定し、レポートを4回に分けて生成していました。2回目以降のリクエストでは、それまでに生成された本文を入力に含めて「この続きから」と依頼する方式です。

この方式には、使い続けて見えてきた問題が三つありました。

  1. 継ぎ目の品質が安定しない。「続きから書いてください」と依頼すると、「承知しました。続きを記載します」のような前置きが入ったり、直前の段落を少し言い直してから再開したりすることがあります。毎回ではないのですが、4回つなげば高い確率でどこかに混入します。
  2. 構成がドリフトする。後半のリクエストでは Claude が文書全体を「資料として渡された本文」越しにしか見ていないため、見出しレベルの解釈が変わることがありました。前半は ### だった粒度が後半は ## になっている、という具合です。
  3. 入力トークンが累積する。2回目は1回目の本文を、3回目は1〜2回目の本文を入力に再送します。つまり分割回数が増えるほど、同じテキストに何度も入力課金がかかります。

どれも致命的ではありません。ただ、毎月発生する20分の検品と手直しは、自動化の趣旨からすると本末転倒だと感じていました。

Fable 5 の出力仕様を確認する — 128k 出力と常時適応思考

Claude Fable 5 は Opus の上に位置づけられた Mythos クラスの一般提供版で、コンテキストウィンドウは 100 万トークン、出力は最大 128,000 トークンです。API でのモデル文字列は claude-fable-5、価格は入力 $10 / 出力 $50(100万トークンあたり)です。1M コンテキストはかつて Claude Sonnet 4.5 / Sonnet 4 の1Mトークンコンテキスト廃止:2026年4月30日までに完了すべき移行ガイドで書いたとおりベータ提供が終了した経緯がありますが、Fable 5 では標準仕様として戻ってきた形になります。

実装前に押さえておきたい仕様が二つあります。

常時適応思考と output_tokens の関係

Fable 5 は「常時適応思考」を備えていて、タスクの難しさに応じて考える量を自動調整します。私の実行ログでは、保存された本文から概算したトークン数より usage の output_tokens が1〜2割ほど多く記録されていました。思考分が出力側に乗っていると理解しています。費用を見積もるときは「本文の長さから逆算」ではなく「実測の usage から計算」が安全です。

長い出力はストリーミングが前提

128k 級の出力は、生成に数分かかります。非ストリーミングの一発リクエストで待つ設計にすると、HTTP 接続のタイムアウトと正面衝突します。Anthropic SDK も長時間リクエストにはストリーミングを促す挙動になっているため、最初からストリーミングで受け切る実装にしておくのが現実的です。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
出力上限のたびに「続きから」と投げ直していた長文生成を、128k トークンのストリーミング一括出力に置き換えられる
途中切断しても部分保存と assistant 継ぎ足しで再開できる Python の実装パターンを持ち帰れる
分割と一括の費用差(実測で約26%)を usage から試算し、6月23日以降の usage credits 消費を見積もれるようになる
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Claude Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥1,480 の永久アクセス
メンバーシップを見る →

関連記事

API & SDK2026-05-14
Claude API でアプリ内 AI チャットを実装して踏んだ6つの罠 — 本番投入までの設計記録
Claude APIをアプリ内チャットに組み込んで本番で直面した6つの設計ミスを、個人開発での実運用経験から解説。コンテキスト設計、ストリーミング、セッション管理、コスト監視の実装パターンを動くコード付きで紹介します。
API & SDK2026-05-12
Haiku 4.5・ストリーミング・プロンプトキャッシングを組み合わせて個人開発アプリのAPIコストを抑えた記録
Claude Haiku 4.5、ストリーミング、プロンプトキャッシングの3つを組み合わせることで、個人開発アプリのAI機能のコストと応答速度を同時に改善した実装パターンを記録します。
API & SDK2026-07-12
非ストリーミングの長い応答が10分の壁で黙って二重課金されていた — SDK既定のタイムアウトと自動リトライを設計し直す
Anthropic SDK の既定タイムアウト10分と自動リトライ2回が、長い非ストリーミング応答を裏で二重に走らせて課金することがあります。発生の仕組みと、ストリーミング切替・明示的な timeout/max_retries・ローカル台帳で止める実装を、実測値とともにまとめました。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →