CLAUDE LABEN
VERSION — 8月10日に v2.1.227 が出ていました。新機能はなく、プラン判定と CI まわりの不具合修正が中心ですAUTO — 8月14日の既定化まで残り2日です。Pro・Max・Team で Claude Code の auto モードが既定で有効になりますCI — claude-code-action で allowed_non_write_users を指定すると GitHub ホストランナー上の Bash が全て失敗していた問題が直りましたBILLING — 期限切れトークンで開始したセッションが加入プランを取り違え、Max 利用者に使用クレジットの有効化を促していた不具合も解消していますSUNSET — 旧 Workbench と実験的プロンプトツール API の廃止は8月17日で、残り5日ですPRICE — Sonnet 5 のプロモ価格 $2/$10 per Mtok は8月31日までで、9月1日から $3/$15 per Mtok になりますVERSION — 8月10日に v2.1.227 が出ていました。新機能はなく、プラン判定と CI まわりの不具合修正が中心ですAUTO — 8月14日の既定化まで残り2日です。Pro・Max・Team で Claude Code の auto モードが既定で有効になりますCI — claude-code-action で allowed_non_write_users を指定すると GitHub ホストランナー上の Bash が全て失敗していた問題が直りましたBILLING — 期限切れトークンで開始したセッションが加入プランを取り違え、Max 利用者に使用クレジットの有効化を促していた不具合も解消していますSUNSET — 旧 Workbench と実験的プロンプトツール API の廃止は8月17日で、残り5日ですPRICE — Sonnet 5 のプロモ価格 $2/$10 per Mtok は8月31日までで、9月1日から $3/$15 per Mtok になります
記事一覧/API & SDK
API & SDK/2026-06-19上級

Claude × Playwright のブラウザエージェントが「成功したつもり」で失敗するとき — 操作を検証し UI の変化に先回りする実装メモ

Claude API と Playwright のブラウザエージェントは、視覚で判断する分だけ「やったつもりで失敗する」誤成功が起きます。自己申告を信じず操作を事後検証する設計と、UI 変化に先回りで気づくドリフト検知の実装をまとめます。

playwright2browser-automation2agent10claude-api81production87typescript11

プレミアム記事

「カートに追加しました」と報告したのに、カートは空だった

夜間に走らせていた収集エージェントのログを朝に開くと、completed: true がずらりと並んでいました。けれど実際の成果物は半分しか揃っていない。ステップを追うと、あるサイトで「商品をカートに追加し、決済画面まで進みました」とエージェントが自信満々に報告しているのに、カートは最後まで空のままでした。クリックは座標の上では成功し、スクリーンショットには「追加」ボタンが押された風の見た目が写っている。それでも、肝心の状態は何も変わっていなかったのです。

これは Playwright のセレクタが壊れる、という昔ながらの故障とは質が違います。命令型スクリプトは壊れると例外を投げて止まってくれるので、少なくとも気づけます。やっかいなのは、Claude にスクリーンショットを見せて次の操作を判断させる視覚エージェントが、壊れずに「成功したつもり」で先へ進むことです。例外も出ず、ログも緑のまま、結果だけが間違っている。本番で一番こわいのはこの静かな失敗です。

ここから、エージェントの自己申告をいっさい信用しない前提で、各操作を目標に結びつけて事後検証する設計と、UI の変化に壊れる前に気づくドリフト検知を、動くコードとともに整理していきます。対象は TypeScript で Playwright と Claude API を触ったことがある方です。

なぜ視覚エージェントは「やったつもり」になるのか

命令型の Playwright スクリプトと、Claude にスクリーンショットを渡して判断させるエージェントでは、失敗の出方が根本的に違います。

観点命令型スクリプト視覚エージェント
UI 変更時の挙動セレクタ不一致で例外 → 停止見た目で推論し操作を続行
失敗の検知例外で即わかる静かに誤った状態へ進む
成功の判定根拠明示的な waitForSelectorモデルの「達成した」という自己申告
怖さ止まるが気づける止まらないが間違っている

誤成功が生まれる3つの経路

ここが最初の落とし穴です。誤成功(false success)が生まれる経路は、私が見てきた範囲では概ね3つに集約されます。第一に、クリック自体は座標上で成立したが、ボタンが無効化されていた・モーダルに覆われていた等で副作用が起きなかった場合。第二に、スクリーンショットの撮影タイミングが非同期更新より早く、操作前の画面を見て「変わった」と誤認する場合。第三に、モデルが目標達成を楽観的に宣言する場合です。Claude は親切なので、ゴールに近い画面を見ると「達成できたと思います」と寄せてくることがあります。

共通する根っこは一つで、「操作した」ことと「状態が目的どおり変わった」ことを同一視している点です。ここを切り離すのが設計の出発点になります。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
視覚エージェント特有の「誤成功(false success)」がなぜ起きるかと、自己申告を信用しない検証ゲートの設計
目標に紐づけた事後検証(goal-bound assertion)と、DOM を根拠にした二重確認の実装コード
UI ドリフトをカナリアで先回り検知し、誤成功率をメトリクス化してサーキットブレーカーで止める運用パターン
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Claude Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥1,480 の永久アクセス
メンバーシップを見る →

関連記事

API & SDK2026-03-31
Claude API で自己修復型AIエージェントを構築する — エラー検出・自動リカバリ・グレースフルデグラデーションの本番実装パターン
障害を自動検出して自己修復する本番向けAIエージェントをClaude APIで構築します。エラーの7分類と最適なリカバリ戦略、指数バックオフ付きリトライ、コンテキスト圧縮による自動回復、Supervisorパターンでのマルチエージェント修復、ツール呼び出しのフォールバックチェーンまで実装します。
API & SDK2026-07-13
Claude API の同時実行を束ねる — シングルフライトで重複推論とキャッシュ・スタンピードを防ぐ
同一プロンプトが同時に何度も Claude へ飛ぶ重複推論を、シングルフライト(request coalescing)で束ねる設計です。プロセス内・分散環境の実装、ジッター付きリトライ、負のキャッシュまで実測付きでまとめました。
API & SDK2026-07-09
出力は同じ、道筋は違う — エージェントの軌跡を不変条件で守る
既定モデルが入れ替わっても最終出力は正しいまま、ツール呼び出しの道筋だけが静かに変わることがあります。実行トレースを記録し、不変条件で機械的にアサートする軌跡回帰ハーネスを実装コードと実測値で整理しました。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →