確信度のしきい値が防ぐために存在する失敗モード
実際にどれだけ確信しているかにかかわらず常に答えるAIエージェントは、いずれ請求に関する紛争、安全に関する質問、あるいはアカウント固有のエッジケースに対して、確信に満ちた、もっともらしく聞こえるが実は間違っているテキストで答えることになります。そのたった一つの悪い回答は、良い回答12個分よりも多くの信頼を失わせます ― 顧客は経験を平均しません。「チャット」が何か嘘を教えた瞬間を覚えているのです。
確信度のしきい値は、それを防ぐための仕組みです: AIエージェントは、訪問者の質問が、自分が実際に根拠を持つ知識 ― あなたのドキュメント、商品データ、ポリシー ― にどれだけよく一致するかを推定し、その一致がワークスペースが設定した基準を超えたときにのみ直接答えます。
悪い推測の代わりに起きること
しきい値を下回ると、AIは行き詰まったり同じことを繰り返したりはせず ― 人間のエージェントへ引き継ぎ、その引き継ぎには会話全体の要約が伴います: 訪問者が何を尋ねたか、AIがすでに何を試したか、そしてなぜ止まったのか。人間はゼロから始めるのではなく、すでにトリアージ済みの会話を引き継ぐのです。
これはまさに、`handoff.requested`というWebhookイベントが存在する理由でもあります ― 独自のエスカレーションロジック(特定の人にページングする、別システムでチケットを開くなど)を望むビジネスは、固定のタイムアウトやキーワード一致ではなく、AIが人間を必要とすると決めたまさにその瞬間にフックできます。
実際にしきい値をどこに置くべきか
普遍的に正しい数字はありません ― 一般的な商品の質問に答えるワークスペースは、間違った答えが実際の金銭的な結果を招くアカウント固有の請求問題を扱うワークスペースよりも、低い基準を許容できます。正しい直感は、保守的に始め(厳密に必要な数より多くの引き継ぎ)、AIのナレッジベースが実際にどれだけよくカバーしているかについての確信が積み上がるにつれてのみしきい値を緩めることであり、逆ではありません。
RAGを通じてAIにより良く、より最新の知識ソースを与えることは、通常、しきい値そのものを調整するよりも効果的なレバーです ― 本当に良い情報源を持つAIエージェントは、安全マージンを緩めることなく、より多くの実際の質問で自然に確信度の基準を超えます。
実際に重要な指標
解決率は虚栄の数字ではありません ― iNTELIGENCIA VIVAでは、それは文字通りあなたが課金される対象です。なぜなら解決とは、人間が介入することなくAIが終わらせた会話だからです。その整合は意図的なものです: つまり、インセンティブは、正確さにかかわらずどれだけ頻繁に答えるかを最大化することではなく、AIが自分が扱う質問に対して正直に優れていることに向けられています。