Claude Codeに評価用コマンド2種が登場
claude-api build-evalやhillclimbを使う前に、テスト問題のデータが偏っていないか確認する。
Anthropicは、AIアプリの性能を検証するテストの作成や改善を行うeval用の2つのコマンドをClaude Codeに追加した。対話しながらテストを構築する機能と、修正案を隠しデータで検証して過剰適合を防ぎながら最適化を回す機能が提供され、テストの点数だけが上がって本番の成果が変わらない状態を防ぐ仕組みが整えられた。
元の記事:【マジで神】Claude Codeに『eval用の2コマンド』が登場したので、試してみた!点だけ上がる改善『過剰適合』の防ぎ方も解説(note・まさお@未経験からプロまでAI活用・10月3日)