機能・画面・料金は更新が続きます。
最新の正確な情報は Microsoft 公式(Microsoft Learn) をご確認ください。
うまくいった話だけでなく、0%と出て原因を切り分けた過程も含めて書いています。
Copilot Studio でエージェントを作っていると、指示文を1行いじるたびに「さっきまで答えられていたことが、答えられなくなっていないか」が気になります。
とはいえ、毎回すべての質問を手で打ち直して確かめるのは現実的ではありません。
そこで使うのが 評価(Evaluate)です。
よく来る質問をセットにしておいて、まとめて流して点数で見る機能です。
この記事では、その使い方をひととおり見たあと、実際にやってみたら 0% と出てしまった話を書きます。
結論から言うと、0% には2種類あります。
ここを知らないと、直さなくていいものを直しに行くことになります。
評価(Evaluate)とは何か
ひとことで言うと、よく来る質問をセットにして、まとめて流し、答えの質を採点してくれる機能です。
エージェントの編集画面の上部にある 「Evaluate」タブから使えます。
CSVで読み込む/AIに自動生成させる/自分で書く、の3通りで作れます。
「関連性・網羅性」といった質の基準を満たしているかを見ます。
ここの読み方が、この記事の後半のテーマです。
💡 「模範解答」は書けるが、比較には使われない
質問の下に「回答(任意)」を書く欄があります。
ただし General quality は模範解答と突き合わせる方式ではありません(公式にも「期待する回答とは比較しない」と書かれています)。
書いても採点には影響しないので、最初は空のままで大丈夫です。

感覚で「良くなった気がする」を、数字で見られるようにするイメージです。
用意するもの
- Copilot Studio で作ったエージェント(指示文だけの簡単なものでOK)
- Microsoft 365 のアカウント(会社・学校のもの)
- ブラウザ(Edge や Chrome)
⚠️ 評価はプレビュー機能です
この記事の時点で、評価(Evaluation)は プレビュー表示が付いた機能です。
動作が安定しないことがあり、画面や仕様も変わる可能性があります。
あとで書く「0%になった話」も、この前提の上での観察です。
はじめに:評価(Evaluate)の画面までたどり着く
「そもそも評価ってどこにあるの?」という方へ。
特別な設定はいりません。
ふだんエージェントを編集している画面の、上のタブに最初から並んでいます。
- ブラウザで
copilotstudio.microsoft.comを開く - 会社・学校のメールアドレスでサインインする(多要素認証が出たら、いつものスマホ承認でOK)
- 右上や左下の環境名が、使いたい環境になっているか確認する
- 左メニューの 「Agents」(エージェント) をクリックして、作ったエージェントの一覧を出す
- 評価したいエージェントをクリックして開く
- 画面上部のタブを 「Build」から「Evaluate」 に切り替える

一覧では、名前のほかに Channel(どこに公開しているか)と Status(公開済みか下書きか)も確認できます。
評価は下書きの状態でも実行できるので、公開前のエージェントでも大丈夫です。

💡 4つのタブの役割
Build=作る(指示文や道具の設定)/Preview=手で1回試す/Evaluate=まとめて流して採点する/Monitor=公開後の使われ方を見る。
Preview で「1回試す」、Evaluate で「毎回まとめて確かめる」という関係です。
⚠️ 画面が英語で出ます
2026年時点では、新しい画面は英語表示です。
この記事では、どのボタンかを日本語で補足しながら進めます。
慣れてきたら英語のままでも読み進められます。
作り方(実画面つき)
ステップ①:質問セットを作る
「Evaluate」タブを開くと、最初は3つの入口が出てきました。
- CSVをアップロード(テンプレートあり)
- Quick conversation set(エージェントの指示文をもとに、AIが10問を自動生成)
- 自分で質問を書く(Or, write some questions yourself)

今回は3つめの「自分で書く」を選びます。
ふだん手で確かめている質問を、そのまま入れられるからです。

テストしたい質問を書く(1つの会話にまとめて入る)
この画面で質問を5つ書いても、テストケースは「5件」ではなく「1件」です。
5つの質問はひと続きの会話として扱われます。
実際、実行後の画面には
Test cases 1/1 と出ます。質問ごとに分けて見たい場合は、会話(conversation)自体を分けて追加する必要があります。
ステップ②:テスト方法と実行アカウントを決める
右側のパネルで、テストセットの名前とテスト方法を設定します。
- Name に分かる名前を入れる(例:「案内係チェック5問」)
- Test method は General quality(現状これ1つ)
- User profile の「Manage」から、自分のアカウントを選ぶ
- Run(または Evaluate)を押す

💡 アカウントを選ぶ意味
認証済みのアカウントを指定すると、エージェントが持っているツールや接続も使った状態でテストされます。
「メールを送る」などの道具を持たせている場合、それが動くかどうかまで含めて確かめられます。
ステップ③:結果を見る
実行すると1〜2分ほどで結果が出ます。
右側に Score(%)、左側の表に会話ごとの判定が並びます。
⚠️ 確認ポイント ── Score が 0% と出るとき
筆者は最初、これまで手で確かめてきた5つの質問を1セットにしました。
講座の内容を聞く質問が3つ、申し込みの質問が1つ、そして「今日の天気は?」(=答えてはいけない質問)が1つです。
実行した結果は Score 0%。

回答そのものを見に行くと、5問すべてにきちんと答えていました。
講座の内容は出典つきで正確、申し込みには丁寧に対応し、天気の質問はきちんと断っている。中身は問題ないのに0%でした。

結論から言うと、それは完全に無駄足でした😅 0%の意味を読み違えていたんです。

点数そのものより、なぜ0なのかを見るほうが大事だと思います。
切り分けてみた ── 7回まわしてわかったこと
原因を突き止めるために、条件を変えながら評価を7回実行しました。
結果を並べると、はっきりした違いが出ました。
表にすると、こうなります。
| テストした内容 | 結果 | 再現 | わかったこと |
|---|---|---|---|
| 質問5問を1つの会話に(回答が長い) | 0% / Error | 3回とも | 採点そのものが動かない |
| ふつうの質問を2問 | 100% / Pass | 1回 | ツールを持っていても採点できる |
| 「申し込みたいです」1問(道具が動く質問) | Pass | 1回 | ツールは原因ではない |
| 「今日の天気は?」1問(正しく断る質問) | 0% / Fail | 2回とも | 断る回答は採点されたうえで0点 |
実際の画面で見比べると、違いがはっきりします。
まず、質問を減らしたとき。

そして、「今日の天気は?」だけを流したとき。

この4パターンから、2つのまったく違う現象が見えてきました。
わかったこと①:Error と Fail は、意味がまったく違う
どちらも表示は「Score 0%」ですが、中身は別物です。
点がつかなかっただけで、エージェントの回答が悪かったわけではない。
General quality の列も空欄になる。
こちらは回答の内容が基準を満たさなかったという意味。
グレーなら Error、赤なら Fail です。
この違いを知らずに「0%だ、指示文が悪いんだ」と判断すると、実際には採点が動いていないだけなのに、直さなくていいものを直しに行くことになります。
実際、筆者はそうしかけました。
わかったこと②:正しく断ったのに「Fail」になる
「今日の天気は?」に対して、エージェントは指示どおり正しく断りました。
「この案内係は講座のことだけお答えします」と伝えて、天気には答えない。設計どおりの、望んだ動きです。
ところが採点は Fail(0点)。
2回やって2回とも同じでした。
理由は、テスト方法が General quality =「関連性・網羅性」を見る方式だからだと考えられます。答えていない回答は「不十分」と判定される、ということです。
安全のために断ったのに、その安全さが減点される形になります。
混ぜると、正しく動いているのに点数が下がり、数字が信用できなくなります。
ガードレールの確認は、評価とは分けて手で行うのが現実的です。
わかったこと③:質問を詰め込むと、採点が落ちる
残ったのが最初の Error です。
切り分けの結果、ツールでも、断る質問でもありませんでした。
どちらも単独なら、ちゃんと Pass や Fail の判定が返ってきたからです。
違いは「1つの会話に5往復ぶん(質問5+回答5)を詰め込んでいた」ことだけ。
回答はどれも見出しや表を含む長いもので、10メッセージぶんありました。
これを3回実行して3回とも Error。
質問を1〜2問に減らすと、同じエージェントで 100% Pass になります。
ただし「こう作ると落ちる/こう作れば通る」という再現手順ははっきりしています。
テストは、1つの会話に1〜2問まで。
多く試したいなら、会話そのものを分けて追加する。
だから、評価セットはこう作る
ここまでを踏まえた、現実的な作り方です。
多く試したいときは、会話(conversation)自体を分けて追加する。
正しい動きなのに点が下がってしまうため。
まずここを切り分ける。
この形にしておくと、指示文をいじるたびに同じセットを流して、点数の上下だけを見ればよくなります。
評価が「使える道具」になるのは、ここからです。

あいまいな質問だと、正解でも0%になりがちでした。
つまずきポイント(先に知っておくと安心)
- Score 0% が2種類ある → Error(採点できなかった)と Fail(採点して0点)。
丸の色で見分ける。 - 質問を5つ書いてもテストケースは1件 → 5問がひと続きの会話として扱われる。
分けたいなら会話ごと追加する。 - 正しく断る回答は Fail になる → ガードレールの確認は評価セットに混ぜない。
- エラーの詳細は画面に出ない → Error の表示にマウスを乗せても、原因は表示されなかった。
条件を変えて切り分けるしかない。 - 模範解答を書いても採点には使われない → General quality は期待する回答と比較しない方式。
まとめ
評価(Evaluate)は、よく来る質問をセットにして、まとめて流し、点数で見る機能です。
指示文を直すたびに手で全部試すのは無理なので、こういう仕組みがあるのは正直ありがたい。
- ① Evaluate タブから、質問セットを作る(自分で書くのが手軽)
- ② テスト方法は General quality、実行アカウントを選ぶとツール込みで確かめられる
- ③ 0% が出たら、まず Error か Fail かを見分ける
- ④ 1会話は1〜2問まで。
断るのが正解の質問は入れない
プレビュー機能なので、今後仕様が変わる可能性は十分にあります。
それでも、「作って終わりにしない」ための足場としては、いま使い始める価値があると感じました。
📋 この記事で学んだこと
次回のPA45で、続きを一緒に作りませんか
PA45 では、こうした「45分でひとつ作る」ハンズオンを、毎週木曜の夜にオンライン無料でやっています。
一人だと詰まりがちなところも、その場で質問しながら進められます。
🙌 こういうのを、毎週みんなで作っています
PA45は知識ゼロ・見るだけ参加も大歓迎です。
次回もまた、ひとつ新しいものを一緒に作ります。
お申し込みは下のボタンから(無料)。
次回のPA45に申し込む(無料)毎週木曜の夜・オンライン・参加無料/途中入退室OK・見るだけ参加も歓迎です
過去回のまとめや、PA45がどんな勉強会かは PA45の紹介ページ にまとめています。
また次回、一緒に「できた!」を作りましょう。
※ 本記事は公開日時点の情報をもとに、筆者が実際に学んで試した内容を整理しました。評価(Evaluation)はプレビュー機能であり、画面や挙動は更新されることがあります。最新の状況は公式情報(Microsoft Learn)もあわせてご確認ください。記事中の結果は筆者の環境で実行したもので、7回の実行のうち同じ条件を複数回くり返して確認しています。
※ 掲載している画面は、実際の操作画面をもとに、個人情報などを避けて描き直した再現イメージです。構成や図解の一部は、AI と壁打ちしながら作成しています。

コメント