AIモデルやプロンプトを変更すると、文章の自然さだけでなく、必要な情報の抜け、回答形式、連携先へ渡す値が変わることがあります。変更前後を比べるために、実際の業務を代表する入力を固定します。
何を評価するかを、仕事の合格条件から決める
LLMの評価には、一般的な能力を比べるベンチマークと、実際の仕事で使えるかを確かめる業務の評価があります。この記事では後者を扱います。モデル単体の回答、資料を検索した後の回答、外部ツールを含む処理では、誤りを調べる場所が違います。
| 評価する軸 | 問い合わせ分類の例 | 記録するもの |
|---|---|---|
| 内容の正確さ | 契約の相談と営業案内を区別できる | 期待分類と根拠の原文 |
| 情報の保持 | 二つの依頼があるメールで片方を落とさない | 要件の抜けと追加 |
| 出力形式 | 受け付けるカテゴリ名と項目で返す | 形式違反の件数 |
| 権限・実行条件 | 分類だけの試験で返信や削除をしない | 禁止した操作の有無 |
| 人の作業 | 確認・修正を含めて使えるか | 一件ごとの確認時間 |
| 費用・待ち時間 | 再生成も含めた負担が許容範囲か | 一業務の消費量と所要時間 |
評価例は実務の頻度だけで選ばず、短文、欠損、複数要件、判断できない入力も含めます。「不明」と返すべき問いにもっともらしい答えを出すことも、失敗として記録します。採点に別のAIを使う場合は、その判定も人がサンプル確認し、重要な誤りを平均点で隠さないようにします。
架空の10件で分類が9件正しくても、残り1件が重大な障害報告を営業案内へ回した結果なら、90%という数値だけで採用しません。何を重大とするか、どの条件を満たしたら試行範囲を広げるかを、結果を見る前に決めます。そのうえで、同じ試験をモデルや指示文の変更時に繰り返します。
期待する答えを項目で定義する
提案準備なら「同じ文章が出ること」より、対象範囲、未確認事項、価格の根拠が残ることが重要です。表現が違っても採用できるものと、意味が変わってはいけない項目を分けます。
| 試験の種類 | 期待する状態 |
|---|---|
| 通常の相談 | 必要な項目をそろえた下書き |
| 価格が不明 | 数字を補わず確認事項にする |
| 資料が矛盾 | 勝手に一方を採用しない |
| 権限外の資料 | 内容や引用を表示しない |
| 出力先が停止 | 確定処理を保留し記録する |
条件をそろえて記録する
モデル、プロンプトの版、参照資料、接続機能、実行日を残します。変更前後で同じ入力を使い、出力だけでなく確認・修正時間と処理費用も比べます。単発の成功だけで安定したと決めないため、変動が問題になる業務では複数回試します。
応答が速くなっても、担当者の修正時間が増えれば全体の負担は減りません。費用も一回の料金だけでなく、再生成や失敗を含む一業務の消費量で見ます。
採用と切り戻しの条件を決める
重大な誤り、権限外の参照、未承認の実行があれば、平均点で打ち消さず個別に扱います。どの結果なら採用し、どの場合に元へ戻すかを、変更前に担当者と合意します。
元の設定へ戻す方法、戻す担当者、実際の利用者への案内を準備してから切り替えます。モデル変更と同時に資料・画面・手順まで変えると、原因の切り分けが難しくなるため、可能な範囲で変更を分けます。業務での効果測定の記録表も利用できます。
代表的な入力と困った出力を整理して、AIの改善試行を相談してください。