VitestとLLMでプロンプト品質をCI検証する
LLMアプリのプロンプト修正時に品質低下を自動で検知したいときに、VitestとAnthropic APIを組み合わせて評価パイプラインを自前実装できる。
AIアプリのプロンプト変更による出力品質の劣化を、単体テストでは検知できない課題に対し、VitestとAnthropicを活用して自動評価するパイプラインの構築手法が解説されている。
元の記事:プロンプト劣化をCIで検出する:Vitest + LLM-as-Judge で評価パイプラインを自前実装する(Zenn・Yukito / 郷由稀斗・10月1日)