RAG 評価ハーネス
AI 窓口の更新で答えが悪くなっていないかを、同じ質問表で確かめます
質問と期待する答えを CSV にまとめておき、更新の前と後で同じように窓口に答えさせます。前回より悪くなった質問は、日本語のレポートの先頭に出ます。手元の端末で動く Node.js のプログラムなので、このページに動く見本は置いていません。下の画面は、購入後に API キーを入れる前に開ける見本(npm run demo:diff)のレポートです。
見本: 更新のあとに悪くなった問いが先頭に出るところ
これは記録した答えと採点を再生するデモで、同梱の記録をそのまま開いた画面です。架空の工務店の文書を入れた AI 案内窓口キットに見本の 20 問を答えさせ、その答えと採点を記録しました。「あと」の記録は、見本の文書の価格表 1 行(キッチンの入れ替え 80 万円〜150 万円)をわざと 100 万円〜190 万円に書き換えて取ったものです。お客さまの実際の窓口で取った結果ではありません。
書き換えた 1 行のとおり、「キッチンの入れ替えはいくらくらいですか」(q05)だけが正解から誤りに変わり、正答率は 100% から 95% に下がります。再生なので、その場で AI に答えさせることはなく、API の費用もかかりません。



誰が使うか
- AI の窓口を作ってお客さまに納める方で、納める前と更新のたびに、確かめた結果を表と文で残したい方
- AI 案内窓口キット・LINE 案内窓口キット・AI 書類読み取りキットを使っていて、文書や設定を変えるたびに答えを確かめたい方
- HTTP で呼べる自前の RAG の窓口を、同じ質問表でくり返し測りたい方
いつ使うか
- プロンプトや、答え方の設定を直したとき
- 答えるモデルを替えたとき
- 窓口に読ませる文書を書き足したり、書き換えたりしたとき
- お客さまに納める前と、納めたあとの更新のとき
- GitHub Actions で、変更のたびに自動で回したいとき(正答率が下がったら失敗にできます)
1 回ごとに数えるもの
- 正答率(正解を 1、部分を 0.5 として数えます)
- 期待した出典との一致(質問表に書いた文書が、答えの出典に入っているか)
- 検索の当たり(検索の結果を返す窓口のときだけ)
- 断りの正しさ(資料に無い問いを断ったか、答えるべき問いで断りすぎていないか)
- 禁止事項の違反(答えてはいけないことを答えていないか)
- 1 問あたりの時間と費用(円)。窓口の分と採点の分を分けて出します
しくみ
質問表は CSV です。Google スプレッドシートや Excel で開いて、1 行に 1 問ずつ書き足せます。要点は「80 万円|150 万円」のように短い語で書き、資料に無いので断るのが正しい問いには「(答えない)」と書きます。
採点は Claude、判定はプログラムが決めます。Claude には要点ごとに「述べている・触れていない・食い違う」の印を付けさせ、正解・部分・誤り・無回答の判定は、その印からプログラムが決めます。同梱の 30 件(人が判定を付けた答え)では、人の判定との一致は 29/30 でした。採点は目安なので、悪くなった問いは答えを読んでお確かめください。
結果は日本語の HTML 1 枚で、ほかのファイルを読み込まないので、メールに添付してもそのまま開けます。日本語と英語の要約(Markdown)、表計算ソフト用の CSV、CI 用の JSON も書き出します。
つなげる窓口
- AI 案内窓口キット(手元のキットのフォルダを呼ぶ形と、置いた先の URL を呼ぶ形)
- LINE 案内窓口キット(手元のキットのフォルダで答えを作ります。LINE には何も送りません)
- AI 書類読み取りキット(手元のキットのフォルダで書類を読み取り、項目ごとに確かめます)
- 任意の HTTP の窓口(質問を送って答えと出典を受け取る形。応答の形が違うときは、対応表の JSON で指定します)
できないこと
- 答えを良くする直しは行いません。直すのは人です
- 文書から質問表を自動で作ることはできません
- 画面のあるサーバー、複数の利用者、結果の履歴の保管先はありません(結果は手元の runs/ のフォルダに残ります)
- 採点に使えるのは Claude だけです
- 文書の本文に照らして、答えが裏づけられているかの採点は行いません
- 読める質問表は CSV だけです(xlsx は読めません)
AI の利用料の目安
AI の利用料は、ご自身の Anthropic のアカウントから別途お支払いいただきます。2026 年 10 月 3 日に見本の 20 問を記録したときの額(概算)は、AI 案内窓口キットでキットの分 42 円と採点の分 7 円、LINE 案内窓口キットでキットの分 37 円と採点の分 5 円、AI 書類読み取りキットで 125 円でした。円は 1 ドル 150 円で換算しています。実際の額は、文書の量や質問の数によって変わります。
送られるもの
- 採点のために Anthropic へ送るのは、質問・期待する要点・答えてはいけないこと・答え・出典の題と URL だけです。文書の本文と書類そのものは送りません
- 発行者のもとには何も送られません
- API キーは環境変数からだけ読み、ログやレポートには書きません
- レポートと要約では、答えの中のメールアドレス・電話番号・9 桁以上の数字を伏せ字にします
入っているもの
- プログラムと、日本語の手順書(README)
- 3 つのキットと HTTP の窓口に向けた見本の質問表
- 見本の再生の記録(更新の前と後)
- 採点の確かめに使う 30 件
- GitHub Actions の例
必要なもの
- Node.js 20 以上
- Anthropic のアカウントと API キー(採点と、手元で呼ぶキットの両方に使います)
- 測るキットのフォルダ(展開して npm install を済ませたもの)か、HTTP で呼べる窓口
- コマンドを打つ画面(ターミナル)の基本的な操作
価格と購入
¥5,980(税込)の買い切りです。月額料金はありません。改変と、お客さまの環境への組み込み納品は自由で、再配布・転売・同種の商品としての販売はできません ── note / BOOTH