Coding Agentを使っていると、「どれだけコードを書けるか」に目が行きがちです。けれど、最近の調査メモを整理していて、もう一つ大事な評価軸が見えてきました。そのタスクで本当に変更すべきかどうかです。
これは単なる慎重論ではありません。2026年5月に出てきた研究でも、Coding Agentが「変更不要のタスク」や「範囲外の作業」をうまく扱えない問題が続けて扱われています。たとえば arXiv の Coding Agents Don't Know When to Act は、コード変更が不要な200件のタスクでエージェントがどう振る舞うかを評価しています。別の Overeager Coding Agents も、良性タスクに対する範囲外行動を測っています。
自分の週次メモでも、同じ方向の気づきが残りました。Coding Agent周辺の課題は、モデルの実装能力だけでなく、scope、authority、abstention、つまり「やってよい範囲」「権限」「あえて止まる判断」に寄ってきています。
「何もしない」は失敗扱いされやすい
多くの開発タスクでは、エージェントに依頼した時点で「何か変更してほしい」という期待が混ざります。issueを渡す、テストを直してと言う、設定を見てと言う。すると、エージェント側も変更差分を出すことが成功だと解釈しやすくなります。
しかし実務では、正しい答えが「変更しない」になる場面があります。
- 既に修正済みで、追加変更すると逆に壊れる
- 問題がコードではなく設定や運用手順にある
- 依頼文の情報だけでは、複数の修正方針がありすぎる
- 権限や対象範囲を越える操作が必要になる
- 再現できないので、まず観察結果を返すべき
この時に「変更なしで終了」「質問する」「人間レビューに回す」が成功として設計されていないと、エージェントは無理に差分を作りに行きます。小さな便利さの裏で、余計な修正、設定変更、テストの過剰なモック化、関係ないファイルの編集が増える原因になります。
個人開発で使える3つの出口
個人開発で大きな評価基盤を作る必要はありません。まずは、エージェントに「差分を出す」以外の出口を明示しておくだけでも効果があります。
1. no-action success
調べた結果、変更しないことが正しい場合の出口です。たとえば「再現手順を確認したが、現在のコードでは既に満たしている」「ドキュメントの記述と実装が一致している」などです。
この出口では、差分ではなく根拠を残します。見たファイル、実行した確認、変更しなかった理由、次に観察すべき条件を短く書けば十分です。
2. ask-before-change
複数の修正方針があり、どれを選ぶかで仕様が変わる場合の出口です。ここで無理に進めると、あとから「実装はできているが意図と違う」状態になりやすいです。
質問は長くしない方が使いやすいです。「A案なら互換性維持、B案なら整理優先」のように、選択肢と影響をセットで返すだけで、人間の判断がかなり楽になります。
3. human-review gate
権限、公開範囲、課金、認証、既存データ、外部サービスに触れる場合の出口です。これはエージェントの能力不足ではなく、そもそも自動で決めるべきではない領域です。
この出口では「何が分かっていて、何が未確認で、どの操作が危ないのか」を短く残します。実行しなかった操作そのものをログに残すと、次のレビューで判断しやすくなります。
プロンプトよりも成果物の形を変える
「慎重にやって」とプロンプトに書くだけでは弱いです。エージェントは最終的に、求められた成果物の形へ引っ張られます。だから、成果物テンプレート側に「変更しない成功」を置く方が安定します。
たとえば、作業結果の最後に次の項目を固定で入れます。
- 変更したか: yes / no
- 変更しなかった理由
- 確認した根拠
- 未確認の点
- 人間判断が必要か
これだけでも、エージェントの報告は「それっぽい完了報告」から「次に使える判断材料」に近づきます。
小さなチェックリスト
Coding Agentに作業を渡す前に、次の5つを決めておくと事故が減ります。
- このタスクで変更してよい範囲はどこか
- 変更不要だった場合、何を成功報告にするか
- 質問してよい条件は何か
- 人間レビューに戻す条件は何か
- 検証できなかった時に、どこまで記録すればよいか
自律性を上げるほど、止まる設計も必要になります。強いエージェントとは、いつでも動くエージェントではなく、動くべき時と止まるべき時を分けられるエージェントです。
参考
- Coding Agents Don't Know When to Act
- Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks
- What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents
画像候補: 「コード差分、質問、停止判断の3つの出口を並べたシンプルな日本語図解」。alt案は「Coding Agentの作業出口として変更、質問、停止を分ける図」。本文は画像なしでも成立します。
