Falcon Information — ホームに戻る

AIによる音声カスタマーサポートにおける遅延や中断を測定する方法:VAD(音声アクティビティ検出)、バッジイン、およびローテーション設計

AIによる音声対応で、応答が途切れる原因は必ずしもモデルだけではありません。電話回線、音声認識、音声アクティビティの検出、タイミングの判断、モデルの推論、企業API、音声合成など、これらの要素が連携して動作するため、それぞれの処理に時間がかかると、ユーザーがまだ話していない内容が途切れてしまう可能性があります。正確な評価方法としては、「応答の秒数」だけを測るのではなく、遅延、中断、およびタスクの結果を総合的に観察することが重要です。

この記事のセクション

  • ·遅延連
  • ·VAD とサイクル
  • ·Barge-in
  • ·測定口径
  • ·実環境でのテスト
  • ·長柄の道具を呼び出す
  • ·証拠の限界

AIによる電話の待ち時間は、どこから来るのでしょうか?

通話の開始にあたり、最初に電信やSIP/PBXを経由し、音声が処理された後、システムは通話者が話が終わったかどうかを判断します。その後、モデルが企業ツールを認識し、最後に返信を音声として電話に転送します。CRMの照会や工藤の作成など、ツールを使用する際には、遅延が発生する可能性があります。モデルが認識する最初のトークンのみを考慮するため、通話者が実際に体験する全体の経路は無視されます。

AIによる音声顧客対応における、エンドツーエンドの遅延解析
階段測定開始と終了一般的なリスク
電話回線によるデータ伝送通話の音声が、入室・退室の音声プラットフォームと連携する。電信回線、符号化・復号、ネットワークの不安定性、およびパケットの喪失
ステップごとの判断ユーザーは発話を停止し、システムが終了を確認するまで待機します。あまり長く待ったり、または時期を早くすぎに終了させたりした場合
モデル回答有効な入力が提供され、再生可能なコンテンツが生成される。文脈が長すぎる、モデルの選択、複雑な推論
ツール呼び出しAPI を呼び出して、利用可能な結果を取得する企業システムがタイムアウトした場合、再試行とキューへの格納
音声再生テキストや音声が、電話を通じて再生されるように設定する。合成的なバッファ、ヘッドホンでの待機と再生の停止

VADは、「話しているかどうか」を判断し、フレーム識別は「話が終わったかどうか」を判断します。

サーバー側のVADは、通常、音量と沈黙の時間に基づいて、音声の開始と停止を判断します。Semantic VADは、さらに、音声の意味が完全に伝わっているかどうかを推定します。長い待ち時間を設定すると、途中で切断されるリスクを減らすことができますが、停止時間が長くなります。逆に、反応が速すぎると、「えー、これを変更したいな」のような発話を途中で切り離してしまう可能性があります。パラメータは、氏名、住所、コード、および自由記述欄など、それぞれ異なる要件に合わせて調整する必要があります。

「バージュ・イン」は、特定の操作を中断するための機能であり、必ずしも処理の完了を意味するものではありません。

「バージュイン」機能は、通話中にAIが再生している音声に、通話者が割り込み、元の応答を中断できるようにします。これにより、情報の修正、既知の情報へのスキップ、メニューの短縮などが可能になります。ただし、「バージュイン」とシステム側の「通話終了を判断」は、異なる機能です。一般的に、通話への割り込みは許可されるべきですが、録音による通知、必要な情報の開示、または重要な項目を確認する際に割り込みを許可するかどうかは、企業のプロセスや法務要件によって個別に決定する必要があります。「バージュイン」機能を完全に無効にすると、会話が遅れる可能性があります。また、「バージュイン」機能を完全に有効にすると、必要な情報が再生されない可能性があります。

単に平均遅延だけを報告するのではなく、p50、p95、およびエラー発生頻度も同時に確認することが重要です。

平均値は、極めて遅いサンプルや、極めて速いサンプルの影響を受けやすい。p50は、一般的な通話体験を把握するために使用し、p95は、より悪くても頻繁に発生する末端のケースを把握するために使用する。さらに、発話停止から応答までの時間、ツールの完了時間、エラーによる途切れ、エラーによる待機、および会話への介入がうまくいかないケースなども記録する。各サンプルには、タスク、ネットワーク、言語、および企業APIへの呼び出しの有無といった情報も付記する必要がある。そうすることで、異なる状況が混在し、問題の原因特定が困難になるのを防ぐことができる。

遅延とローテーションは、同時に記録することが重要です。
観察項目事件の定義用途
最初の返信の遅延確認手順が完了し、ユーザーが返答を聞くまでの時間ラウンド、モデル、および合成の待ち状況を区別する
ツールが準備完了するのを待っていますAPI から返されたデータが利用可能になっている企業システムやサードパーティのボトルネックを特定する
エラーによる途切れユーザーがまだ発言を終えていないにも関わらず、返信を開始してしまう。VAD(音声活性検出)、レイアウト、および列の戦略の調整
誤った情報の待機ユーザーは発言を終えたにも関わらず、システムが応答しない。終了判定、時間超過、およびツールの状態の確認
会話が成功に終わったユーザーが発声を終えた後、元の音声は停止され、新しい音声が記録されます。再生の確認と、文脈との整合性の検証

実際の電話テストには、ノイズ、エコー、方言、長い入力欄なども含める必要があります。

ウェブサイト用のマイクが、静かなオフィス環境で良好な結果を示すことは、携帯電話、車内、ハンズフリー、Bluetoothイヤホン、または固定電話での使用を保証するものではありません。テストでは、背景の音、残響、信号の不安定さ、話す速度の速さ/遅さ、一般的なアクセント、数字、アルファベットと住所などの要素を網羅する必要があります。特に重要な項目については、単に正確な文字を表示するだけでなく、システムが内容を再提示し、ユーザーが修正できるようにし、不確実な場合はテストを停止できるようにすることが目標です。

長期間にわたってツールを呼び出す場合、単なる「成功」の偽装で沈黙を埋めることは避けるべきです。

CRM、ERP、または注文受付APIは、数秒から非同期処理に時間がかかる場合があります。システムは、簡潔な進捗状況を示すことで、状況を把握しやすくすることができますが、「完了」という表現は、結果が返ってくる前には使用できません。会話時間内に収まる範囲で、確認待ち、手動での対応、または後続の通知を設定し、一意の識別子を使用することで、重複した処理を防ぐことが重要です。結果の正確性を犠牲にしながら、処理の遅延を改善することは、単にエラーをより早く伝えることと同義です。

「3 秒」はあくまで設計目標であり、GoGoCha が公表している SLA(サービスレベル契約)ではありません。

GoGoCha の公開事例では、電話によるアクセスと即時対応のワークフローが示されていますが、エンドツーエンドの遅延分布、通信環境、通話サンプル、およびSLAに関する情報は公開されていません。同様の事例を定義し、正確な測定を行うまでは、製品の設計目標を達成されたサービス水準として記述することは適切ではありません。企業は、自社のPBX/SIP、API、およびピーク時の状況下で、p50、p95、および失敗事例を再構築する必要があります。

参考文献

よくある質問

AIによる音声でのカスタマーサポートは、必ずしも1秒以内の応答時間で自然なコミュニケーションが可能なのでしょうか?
すべてのタスクで共通の時間を設定することはできません。短い質問への回答や、企業システムへの問い合わせなど、異なる種類のタスクには、それぞれ異なる時間が必要です。また、待機時間だけでなく、ユーザーへの通知、進捗状況の正確な報告、および結果の報告も、タスクの質に影響を与えます。
サーバーサイドの VAD とセマンティック VAD、どちらが優れているか?
これは、サプライヤーのサポートと通話形式によって異なります。Server VAD は、無音パラメータによる制御が比較的容易です。Semantic VAD は、文脈の完了を待つことができますが、遅延が発生する可能性があります。ご自身の言語、フィールド、および電話のサンプルと比較して判断してください。
ウェブサイトのデモはスムーズに動作するのに、電話での操作は遅くなるのはなぜですか?
実際の電話回線は、回線の種類、エンコード・デコード方式、ネットワーク品質、およびPBXによって異なる。そのため、POC(Proof of Concept)では、正式に採用を検討している電話回線を用いてテストを行う必要がある。

貴社のAI電話プロセスの評価

現在の通話方法、通話後のシステム動作、および例外処理について議論を開始します。要件を提示した後、デモ時間、展示範囲、およびPoC(概念実証)の必要性を確認します。