実際に動かし、対話してみる
同じシナリオをルールベースと LLM でそれぞれ一回ずつ実行し、並べて比較する。
●進行中·第 5 週· 想定 70 分
対話オペレーター
この課題ですること
同じシナリオでも、二つのエンジンでは動きが異なる。ルールベースは固定的で予測しやすく、想定外の状況は有人対応に転送する。LLM は「元の医師に診てもらいたい」を理解し、順序も自分で決めるが、予測しづらい。 違いの原因は「どちらが賢いか」ではなく、「誰が次の一手を決めるか」である。 まずルールベースで一回実行し、次に LLM で一回実行して、二つの Timeline を並べて比較し、少なくとも 3 か所の違いを指摘した対照表を提出する。
合格基準
1 / 3 達成- 同じシナリオでルールベースの Run を一回完了したRun 状態
- 同じシナリオで LLM の Run を一回完了したRun 状態
現時点ではルールベースの一回のみで、まだ LLM エンジンで同じシナリオを開始していない。
- 対照表で少なくとも 3 か所の挙動の違いを指摘し、原因を説明している講師評価
2 か所(手順の順序、時間帯の提案方法)は提出済み。あと 1 か所必要。
このタグはこの項目の事実の出所を示す。「講師評価」を除き、すべてシステム状態から導出され、Agent 自身の申告は信用しない。
状態
進行中
プロトタイプは永続化しません:ページを再読み込みすると仮データの初期状態に戻ります。