先分清楚:这是通路选择,不是技术高下
两者底层都是「理解使用者、查资料、执行动作」的流程,差别在入口。语音客服活在电话里:即时、免打字、对长辈与行动中的使用者友善,但每一秒都在计费、听错就要重来。文字机器人活在网站与 LINE 里:可以慢慢回、可以贴连结图文、对话纪录天然留存,但接触不到只打电话的客群。所以第一个问题永远是:你的客户现在都从哪里来?
语音与文字客服的差别不是技术高下,是通路差异:你的客户习惯打电话,还是习惯用 LINE 与网站?选错通路,再强的 AI 也接不到人。本页把两者的成本结构、失败模式与量测方式摊开比较。
| 面向 | AI 语音客服(电话) | 文字客服机器人(网站/LINE) |
|---|---|---|
| 互动通路 | 电话进线与外拨 | 网站对话框、LINE 官方账号 |
| 典型使用者 | 习惯打电话的客群、开车或不便打字的情境 | 习惯传消息的客群、可非同步往返 |
| 成本结构 | 建置+电信线路+语音辨识合成+模型用量 | 建置+模型用量(少了电信与语音层) |
| 整合需求 | PBX/SIP、代表号、录音政策、并发容量 | 网站或 LINE 入口、知识库、后端 API |
| 主要失败模式 | 辨识错误、噪音口音、通话中断 | 意图误判、模型幻觉、答非所问 |
| 量测指标 | 接通与完成率、栏位取得率、转人工率 | 解决率、对话轮次、转人工率 |
| 隼讯起价 | 需求与环境盘点后报价 | TWD 30,000 专案起(AI 客服 MVP) |
两者底层都是「理解使用者、查资料、执行动作」的流程,差别在入口。语音客服活在电话里:即时、免打字、对长辈与行动中的使用者友善,但每一秒都在计费、听错就要重来。文字机器人活在网站与 LINE 里:可以慢慢回、可以贴连结图文、对话纪录天然留存,但接触不到只打电话的客群。所以第一个问题永远是:你的客户现在都从哪里来?
文字机器人的成本结构比较单纯:一次性建置加上模型 API 用量。语音客服在这之上多了三层:电信层(号码月租、通话分钟)、语音层(辨识与合成按音讯计费)、以及并发容量(尖峰同时来电数决定线路与运算配置)。这也是为什么我们的文字客服 MVP 有公开起价(TWD 30,000),语音专案却坚持先盘点环境再报价——没看过 PBX、并发与录音需求就报的价格,多半不含你真正需要的范围。
文字机器人的主要风险是理解层面:意图误判、模型幻觉、答非所问——补救靠知识库品质、回答限制与转真人机制。语音客服除了这些,还多了声音层面的风险:辨识错误、背景噪音、口音、通话中断。所以语音流程必须设计重述确认(重要栏位让使用者确认一次)、低信心转人工、断线后的状态保存。评估厂商时,直接问「听错的时候会发生什么事」,答不清楚的展示都只是理想情境。
判断方式很务实:翻你现在的客服纪录。进线电话占大宗、客群偏好口语沟通(例如在地服务、年长客群)——语音优先;询问集中在 LINE 与网站表单、问题适合图文回覆(例如电商、预约服务)——文字优先;两边都有量,先做量大的那一边,验证流程后再扩充另一边。预算有限时,文字机器人是比较低门槛的起点,因为少了电信与语音层的复杂度。
成熟的架构是把语音与文字当成同一套系统的两个入口:知识库共用(维护一份)、后端动作共用(查订单、建工单、转人工走同一套 API)、对话策略依通路调整(语音要简短口语、文字可以贴连结)。我们公开的 GoGoCha 案例就是这个思路——电话、网站、LINE 三个入口接到同一套派单后端。先做哪个入口都可以,重点是后端设计时就预留多通路,避免之后重做。