Showcase へ戻る

RAG 評価ハーネス

AI 窓口の更新で答えが悪くなっていないかを、同じ質問表で確かめます

質問と期待する答えを CSV にまとめておき、更新の前と後で同じように窓口に答えさせます。前回より悪くなった質問は、日本語のレポートの先頭に出ます。手元の端末で動く Node.js のプログラムなので、このページに動く見本は置いていません。下の画面は、購入後に API キーを入れる前に開ける見本(npm run demo:diff)のレポートです。

見本: 更新のあとに悪くなった問いが先頭に出るところ

これは記録した答えと採点を再生するデモで、同梱の記録をそのまま開いた画面です。架空の工務店の文書を入れた AI 案内窓口キットに見本の 20 問を答えさせ、その答えと採点を記録しました。「あと」の記録は、見本の文書の価格表 1 行(キッチンの入れ替え 80 万円〜150 万円)をわざと 100 万円〜190 万円に書き換えて取ったものです。お客さまの実際の窓口で取った結果ではありません。

書き換えた 1 行のとおり、「キッチンの入れ替えはいくらくらいですか」(q05)だけが正解から誤りに変わり、正答率は 100% から 95% に下がります。再生なので、その場で AI に答えさせることはなく、API の費用もかかりません。

レポートの上の部分。正答率 95%(前回から 5 ポイント下がった)、期待した出典との一致・断りの正しさ・禁止事項の違反・1 問あたりの時間の札と、前回から悪くなった問い q05
レポートの上の部分。正答率が前回から 5 ポイント下がり、悪くなった問い(q05)が先頭に出ています(同梱の記録の再生)
問いごとの結果の表。ID・タグ・質問・判定・要点の印・出典・違反・時間・円が 1 問 1 行で並び、q05 だけが誤り
問いごとの結果の表。要点の印(● 述べている・× 食い違う)と判定が並び、判定とタグで絞り込めます(同梱の記録の再生)
q05 の「答えと採点」を開いたところ。答えの全文、出典、採点の理由、前回の判定(正解)
q05 の「答えと採点」を開いたところ。答えの全文・出典・採点の理由・前回の判定が並びます(同梱の記録の再生)

誰が使うか

  • AI の窓口を作ってお客さまに納める方で、納める前と更新のたびに、確かめた結果を表と文で残したい方
  • AI 案内窓口キット・LINE 案内窓口キット・AI 書類読み取りキットを使っていて、文書や設定を変えるたびに答えを確かめたい方
  • HTTP で呼べる自前の RAG の窓口を、同じ質問表でくり返し測りたい方

いつ使うか

  • プロンプトや、答え方の設定を直したとき
  • 答えるモデルを替えたとき
  • 窓口に読ませる文書を書き足したり、書き換えたりしたとき
  • お客さまに納める前と、納めたあとの更新のとき
  • GitHub Actions で、変更のたびに自動で回したいとき(正答率が下がったら失敗にできます)

1 回ごとに数えるもの

  • 正答率(正解を 1、部分を 0.5 として数えます)
  • 期待した出典との一致(質問表に書いた文書が、答えの出典に入っているか)
  • 検索の当たり(検索の結果を返す窓口のときだけ)
  • 断りの正しさ(資料に無い問いを断ったか、答えるべき問いで断りすぎていないか)
  • 禁止事項の違反(答えてはいけないことを答えていないか)
  • 1 問あたりの時間と費用(円)。窓口の分と採点の分を分けて出します

しくみ

質問表は CSV です。Google スプレッドシートや Excel で開いて、1 行に 1 問ずつ書き足せます。要点は「80 万円|150 万円」のように短い語で書き、資料に無いので断るのが正しい問いには「(答えない)」と書きます。

採点は Claude、判定はプログラムが決めます。Claude には要点ごとに「述べている・触れていない・食い違う」の印を付けさせ、正解・部分・誤り・無回答の判定は、その印からプログラムが決めます。同梱の 30 件(人が判定を付けた答え)では、人の判定との一致は 29/30 でした。採点は目安なので、悪くなった問いは答えを読んでお確かめください。

結果は日本語の HTML 1 枚で、ほかのファイルを読み込まないので、メールに添付してもそのまま開けます。日本語と英語の要約(Markdown)、表計算ソフト用の CSV、CI 用の JSON も書き出します。

つなげる窓口

  • AI 案内窓口キット(手元のキットのフォルダを呼ぶ形と、置いた先の URL を呼ぶ形)
  • LINE 案内窓口キット(手元のキットのフォルダで答えを作ります。LINE には何も送りません)
  • AI 書類読み取りキット(手元のキットのフォルダで書類を読み取り、項目ごとに確かめます)
  • 任意の HTTP の窓口(質問を送って答えと出典を受け取る形。応答の形が違うときは、対応表の JSON で指定します)

できないこと

  • 答えを良くする直しは行いません。直すのは人です
  • 文書から質問表を自動で作ることはできません
  • 画面のあるサーバー、複数の利用者、結果の履歴の保管先はありません(結果は手元の runs/ のフォルダに残ります)
  • 採点に使えるのは Claude だけです
  • 文書の本文に照らして、答えが裏づけられているかの採点は行いません
  • 読める質問表は CSV だけです(xlsx は読めません)

AI の利用料の目安

AI の利用料は、ご自身の Anthropic のアカウントから別途お支払いいただきます。2026 年 10 月 3 日に見本の 20 問を記録したときの額(概算)は、AI 案内窓口キットでキットの分 42 円と採点の分 7 円、LINE 案内窓口キットでキットの分 37 円と採点の分 5 円、AI 書類読み取りキットで 125 円でした。円は 1 ドル 150 円で換算しています。実際の額は、文書の量や質問の数によって変わります。

送られるもの

  • 採点のために Anthropic へ送るのは、質問・期待する要点・答えてはいけないこと・答え・出典の題と URL だけです。文書の本文と書類そのものは送りません
  • 発行者のもとには何も送られません
  • API キーは環境変数からだけ読み、ログやレポートには書きません
  • レポートと要約では、答えの中のメールアドレス・電話番号・9 桁以上の数字を伏せ字にします

入っているもの

  • プログラムと、日本語の手順書(README)
  • 3 つのキットと HTTP の窓口に向けた見本の質問表
  • 見本の再生の記録(更新の前と後)
  • 採点の確かめに使う 30 件
  • GitHub Actions の例

必要なもの

  • Node.js 20 以上
  • Anthropic のアカウントと API キー(採点と、手元で呼ぶキットの両方に使います)
  • 測るキットのフォルダ(展開して npm install を済ませたもの)か、HTTP で呼べる窓口
  • コマンドを打つ画面(ターミナル)の基本的な操作

価格と購入

¥5,980(税込)の買い切りです。月額料金はありません。改変と、お客さまの環境への組み込み納品は自由で、再配布・転売・同種の商品としての販売はできません ── note / BOOTH