Tech.st

AI導入・運用支援 / 実践ガイド / ルール・運用

GUIDE 72 / ルール・運用

LLMの評価方法を業務で決める|品質・費用・モデル変更を確認する試験表

LLMの評価を、業務で必要な条件と代表入力から設計する方法。正確さ、形式、権限、修正時間、費用を分け、モデル変更前後を比較する例を紹介します。

制作にAIを使用。具体例・計算例は説明用です。公開日:2026-09-20

AIモデルやプロンプトを変更すると、文章の自然さだけでなく、必要な情報の抜け、回答形式、連携先へ渡す値が変わることがあります。変更前後を比べるために、実際の業務を代表する入力を固定します。

何を評価するかを、仕事の合格条件から決める

LLMの評価には、一般的な能力を比べるベンチマークと、実際の仕事で使えるかを確かめる業務の評価があります。この記事では後者を扱います。モデル単体の回答、資料を検索した後の回答、外部ツールを含む処理では、誤りを調べる場所が違います。

評価する軸 問い合わせ分類の例 記録するもの
内容の正確さ 契約の相談と営業案内を区別できる 期待分類と根拠の原文
情報の保持 二つの依頼があるメールで片方を落とさない 要件の抜けと追加
出力形式 受け付けるカテゴリ名と項目で返す 形式違反の件数
権限・実行条件 分類だけの試験で返信や削除をしない 禁止した操作の有無
人の作業 確認・修正を含めて使えるか 一件ごとの確認時間
費用・待ち時間 再生成も含めた負担が許容範囲か 一業務の消費量と所要時間

評価例は実務の頻度だけで選ばず、短文、欠損、複数要件、判断できない入力も含めます。「不明」と返すべき問いにもっともらしい答えを出すことも、失敗として記録します。採点に別のAIを使う場合は、その判定も人がサンプル確認し、重要な誤りを平均点で隠さないようにします。

架空の10件で分類が9件正しくても、残り1件が重大な障害報告を営業案内へ回した結果なら、90%という数値だけで採用しません。何を重大とするか、どの条件を満たしたら試行範囲を広げるかを、結果を見る前に決めます。そのうえで、同じ試験をモデルや指示文の変更時に繰り返します。

期待する答えを項目で定義する

提案準備なら「同じ文章が出ること」より、対象範囲、未確認事項、価格の根拠が残ることが重要です。表現が違っても採用できるものと、意味が変わってはいけない項目を分けます。

試験の種類 期待する状態
通常の相談 必要な項目をそろえた下書き
価格が不明 数字を補わず確認事項にする
資料が矛盾 勝手に一方を採用しない
権限外の資料 内容や引用を表示しない
出力先が停止 確定処理を保留し記録する

条件をそろえて記録する

モデル、プロンプトの版、参照資料、接続機能、実行日を残します。変更前後で同じ入力を使い、出力だけでなく確認・修正時間と処理費用も比べます。単発の成功だけで安定したと決めないため、変動が問題になる業務では複数回試します。

応答が速くなっても、担当者の修正時間が増えれば全体の負担は減りません。費用も一回の料金だけでなく、再生成や失敗を含む一業務の消費量で見ます。

採用と切り戻しの条件を決める

重大な誤り、権限外の参照、未承認の実行があれば、平均点で打ち消さず個別に扱います。どの結果なら採用し、どの場合に元へ戻すかを、変更前に担当者と合意します。

元の設定へ戻す方法、戻す担当者、実際の利用者への案内を準備してから切り替えます。モデル変更と同時に資料・画面・手順まで変えると、原因の切り分けが難しくなるため、可能な範囲で変更を分けます。業務での効果測定の記録表も利用できます。

代表的な入力と困った出力を整理して、AIの改善試行を相談してください。

次に読む

導入・費用AI導入の効果測定はどうする?作業時間と品質を比べる記録表ルール・運用プロンプト管理と社内共有の始め方|版・入力例・確認結果をセットで残す導入・費用AIで業務を自動化する手順|入力・判断・承認・例外を一工程ずつ決める
実践記事をすべて見る