このシートは、顧客へ提供する AI 機能を、同じ条件で繰り返し評価するために使います。AI が作った調査・提案資料の確認には付録 E を使います。
機能名・版:
利用者:
利用場面と頻度:
現在の方法:
期待する変化:
AIを使う理由:
AIを使わない比較案:
AIがすること:
AIがしてはいけないこと:
出力後に人がすること:
人へ戻す条件:
責任者:
| 失敗 ID | 失敗内容 | 影響を受ける人 | 影響 | 発生しやすさ | 検知方法 | 予防・軽減 | 公開条件 |
| F1 | | | 小・中・大・重大 | 低・中・高 | | | |
重大な失敗は、平均点とは別に許容件数を決めます。
| 事例 ID | 区分 | 入力 | 期待結果・根拠 | 採点基準 | 重大例 | 利用許可・匿名化 |
| E1 | 代表・境界・例外・安全 | | | | はい・いいえ | |
調整用データ件数:
最終確認用データ件数:
実データの利用目的・権限:
対象顧客・業務の分布を反映したか:
答えない・人へ戻す事例を含むか:
評価データの所有者と更新条件:
モデル・提供者・版:
システム指示・プロンプト版:
検索設定・参照資料版:
前処理・後処理コード版:
安全設定:
実行日時・環境:
反復回数:
比較対象:
| 指標 | 全体 | 重要区分別 | 公開基準 | 結果 | 前版との差 |
| 品質 | | | | 合格・不合格 | |
| 人の修正・棄却 | | | | 合格・不合格 | |
| 応答時間 | | | | 合格・不合格 | |
| 1件当たり費用 | | | | 合格・不合格 | |
| 重大事故 | | | | 合格・不合格 | |
| 人への切替 | | | | 合格・不合格 | |
| 事例 ID | 実際の出力・動作 | 原因仮説 | 利用者への影響 | 対応 | 再評価 |
| | データ・検索・指示・モデル・コード・運用 | | | |
判断: 公開・限定公開・修正後再評価・中止
提供対象と上限:
満たした条件:
満たしていない条件:
例外を承認する人と理由:
既知の限界と利用者への説明:
監視する指標と警報値:
停止条件と停止権限者:
戻す版・代替手段:
次回評価日:
判断者・確認者・日付: