AI催收外呼项目方案

D1-D10 逾期客户对话式催收 · MVP版本 · 2026年8月6日

⚠️ 合规第一原则:催收场景合规敏感度极高(7月末扫黑行动后监管进一步趋严)。所有设计遵循"宁可交互效果保守,不得触碰监管红线"。第一期采用保守方案,先跑通结构再优化效果。

一、项目背景与目标

1.1 业务背景

现状:当前AI外呼仅覆盖 D1-D3 逾期客户的单向提醒通知,无需响应客户交互。D4-D10 阶段客户还款意愿下降,完全依赖人工催收坐席跟进。

痛点:1-10天逾期用户占比最高,催收人力投入巨大。延长AI外呼覆盖周期预计可降低 70%-80% 的人工工作量,同时AI话术输出相比人工更规范、合规风险更低。

团队背景:我部门刚接手催收AI业务线,原算法leader转为合作方。团队具备AI话务基础能力(电销场景对话式AI已落地),但无催收外呼实操经验。

1.2 项目目标

维度目标说明
Demo 8月7日 向业务侧同步电销AI通话demo 基于现有电销对话模式优化话术,确认效果预期(会议已演示汽车金融电销流程)
方案 泰坦方案(短中期落地方案) 复用泰坦对话机器人架构+外部API查询节点;自研agent受GPU资源限制暂缓(无预算)
正式版 9月中旬上线 D1-D7 全周期 第一期客群1-7天:D1-3保留通知模式,D4-7对话式AI交互,D8+人工介入;后续再扩展更长账期
评测体系 支撑灰度AB上线的全链路评测 离线测试集(全意图分支)+ 在线AB分流(话务内部包层灰度切量)+ Badcase闭环;复用王欢自动化评测能力
放量模式 小流量灰度 → 逐步放量 上线先小流量验证效果,确认符合预期后逐步扩大(规避泰坦上下文污染风险)
核心评价指标:客户修复率(Recovery Rate)。配套指标包括:承诺还款率、实际还款率、客诉率、转人工率、通话完成率。

1.3 核心约束

合规红线(不可逾越)

技术约束与已定选型

二、逾期阶段×AI能力分层

逾期阶段 × AI能力分层设计D1-D3提醒通知型D4-D7对话施压型D8-D10强压升级型现有能力(保留)单向话术播报告知逾期事实+提醒无需客户交互★ MVP核心对话式交互意图识别+动态施压协商+承诺锁定转人工兜底后续扩展更强施压策略法律后果告知转人工准备MVP目标D4-7 对话式催收跑通所有核心结构就位效果可差,结构要全升级升级

根据逾期天数递增、客户还款意愿递减的特征,将AI催收能力分为三个阶段:

阶段逾期天数AI能力对话深度施压等级本期覆盖
提醒通知型 D1-D3 单向话术播报 无交互 已有
对话施压型 D4-D7 对话式交互+动态施压 意图识别→施压探因→承诺锁定 中(告知后果→道德施压) MVP核心
强压升级型 D8-D10 更强施压+法律后果告知 升级话术+转人工预备 高(法律后果→信用影响) 后续扩展(非本期)
第一期聚焦(已确认):客群覆盖 D1-D7(D1-3保留现有通知模式,D4-7对话式AI交互),D8+ 由人工坐席介入,后续再逐步扩展更长账期。D4-D7 是从"通知"到"催收"的关键跃迁——AI需要能听懂客户说什么、判断客户意图、选择合适话术回应、动态调整施压策略,并在必要时转人工。

D8-D10 强压型(后续扩展,非第一期)

第一期不覆盖 D8+ 施压场景。D8+ 案件转人工跟进,或后续阶段扩展强压话术(法律后果告知等)。相关设计见第六章行业对标中的 L2→L3 演进。

三、对话框架设计(核心)

这是整个项目的核心——定义AI如何与逾期客户对话。目标是用最低复杂度跑通完整对话闭环,同时确保所有重要能力结构就位。

⚠️ 实现载体已定:泰坦对话机器人(8/6会议确认)。以下对话框架是逻辑设计(状态/意图/话术/合规),实际承载于泰坦平台:
• 复用泰坦对话机器人架构,外部API查询节点在通话前组装客户信息传入机器人上下文
• 对话逻辑通过固定条件判断实现(本期无宽限期调整权限,靠规则规避模型幻觉风险)
• 话术通过外层包层做同话术分流灰度切量(AB测试载体)
• ⚠️ 已知限制:泰坦框架"差3个字符"可用性问题、上下文污染风险、不按TTS播放进度掐断上下文 → 第一期小流量灰度规避

3.1 对话状态机

对话流程采用状态机驱动(对应泰坦的对话流程配置),而非自由生成式对话。状态机核心优势:可控、可测试、可评测——每个状态、每条边都可以构造测试用例。会议中演示的现有电销demo暴露了"系统承接客户打断发言、延伸对话能力不足"的问题,本期通过配套话术(引导客户回到主线)弥补。

AI催收对话状态机(D4-D7 施压型)路由分支协商处理安抚转人工合规底线禁止威胁/辱骂/恐吓禁止透露债务给第三方禁止虚假承诺转人工硬触发• 客户要求人工• 提及投诉/法律/媒体• 合规风险信号开场白身份核验逾期告知告知逾期事实金额/天数/后果施压探因施压话术(梯度递进)探因提问(开放+引导)锁定承诺确认还款时间+金额提供还款渠道事实核实核实合同信息重申法律义务兜底重述换角度重述最多3轮结束语总结+后续动作告知+还款提醒转人工触发转人工传递上下文确认本人推脱型(找理由)配合型(承诺还款)否认/质疑型协商型(延期/分期/减免)情绪型(愤怒/哭泣)沉默/无法识别核实完毕权限内方案超出权限情绪平复情绪失控连续3轮失败

状态流转说明

状态触发条件AI动作退出条件
开场白 电话接通 身份核验(确认本人)→ 表明来意 确认本人
逾期告知 身份确认完成 告知逾期事实:金额、天数、还款截止日 客户已知晓
施压探因 告知完成 梯度施压话术 + 开放式探因提问 客户意图明确
意图响应 意图识别完成 按意图类型匹配响应策略(见3.2) 达成承诺 / 需转人工
锁定承诺 客户承诺还款 确认还款时间+金额,提供还款渠道指引 承诺记录完毕
结束语 对话目标达成 / 上限轮次 总结+后续动作告知+还款提醒 挂断
转人工 触发转人工条件(见3.5) 传递上下文摘要给人工坐席 坐席接管
轮次上限设计:MVP设定单通电话最多 8-10轮对话(不含开场白),防止AI陷入无效循环。到达上限后执行结束语+后续跟进告知,挂断后标记为"需人工跟进"。

3.2 客户意图分类体系

意图识别是对话引擎的"大脑"。MVP阶段定义6类核心意图+ 转人工信号,覆盖催收场景的主要客户反应模式:

意图类型客户表现AI响应策略转人工?
配合型 "我知道了,马上还"/"我明天还" → 锁定承诺:确认时间+金额,提供还款渠道,温和提醒
推脱型 "我这几天没钱"/"工资还没发"/"再等等" → 施压升级:理解困难但重申义务,给出短期方案(如分期首付款),施压梯度+1 否(≤2轮后升级)
否认/质疑型 "我没借过"/"金额不对"/"你们是骗子吧" → 事实核实:核实合同信息、借款金额、还款记录,重申法律义务 连续2轮仍否认→转人工
协商型 "能不能延期"/"能不能分期"/"能不能减免" → 权限判断:MVP仅支持标准化方案(如约定3日内还款),超出权限→转人工 超出AI权限→转人工
情绪型 愤怒/哭泣/焦虑/情绪失控 → 安抚降级:共情+安抚,尝试回到理性沟通;情绪失控→立即转人工 情绪失控→转人工
沉默/无法识别 不说话 / 语音质量差 / 方言无法识别 → 兜底重述:换角度重述逾期事实,提示客户可以说话 连续3轮失败→转人工

转人工硬触发信号(任何状态立即触发)

3.3 施压梯度设计

催收的本质是施压(会议纪要原话:"催收它是施压,你施的对不对,说的对不对")。AI需要根据客户反应动态调整施压等级

施压等级策略话术方向适用场景合规检查
L1 温和提醒 善意告知 "您的XX贷款已逾期X天,欠款XX元,请您尽快安排还款" 开场、配合型客户 ✓ 标准
L2 道义施压 信用后果 "逾期记录将上报征信系统,影响您未来的贷款和信用卡申请" 推脱型客户 ✓ 需确认表述准确
L3 事实施压 法律义务 "根据合同约定,您有义务按时还款,逾期将产生滞纳金/罚息" 连续推脱、否认型 ⚠️ 需法务审核话术
L4 升级预警 后续措施 "如继续逾期,案件将移交后续催收流程,届时将有专人跟进" D6-7、多次推脱 ⚠️ 不得夸大后果
施压红线:施压话术必须经过法务/合规审核后方可入库。MVP阶段建议先用 L1-L2 为主,L3-L4 作为兜底预备但需审核后再启用。所有施压话术禁止:虚构法律后果、夸大处罚措施、使用威胁性措辞。

3.4 合规兜底框架

三层合规防线

第一层:话术入库审核

第二层:实时合规过滤

第三层:事后质检审计

3.5 转人工机制

转人工的完整链路

环节说明MVP实现
触发判定满足硬触发条件或软触发阈值规则引擎(见3.2转人工信号)
上下文摘要向人工坐席传递对话上下文结构化摘要:客户意图、施压等级、对话轮次、关键信息点
平滑过渡AI告知客户即将转接"好的,我帮您转接专员处理,请稍等"
坐席接管人工坐席查看上下文后继续对话CRM工单+对话摘要推送到坐席工作台
结果回写记录转人工原因+处理结果回写催收CRM,标注转人工类型

3.6 客户画像驱动的策略路由

公司已有 C卡风险评分体系还款意愿度模型(已测试,计划并入C卡)。泰坦的外部API查询节点在通话前组装客户信息传入机器人上下文(案件数据、还款结果回查、C卡风险评分接口由催收系统侧提供,见4.4确认清单):

画像维度数据来源对话策略影响
风险等级(C卡)现有C卡评分高风险→施压起始等级更高;低风险→从L1开始
还款意愿度意愿度模型输出低意愿→更早进入施压探因;高意愿→温和引导即可
历史催收记录CRM系统多次承诺未还→施压升级;首次逾期→温和提醒
逾期金额/天数案件系统金额大/天数多→施压等级更高
产品类型案件系统消费贷 vs 车抵贷→话术框架微调(车抵贷可提及抵押物)
第一期简化方案:泰坦API查询节点先接入逾期天数+金额+风险等级3个维度做简单路由(分2-3档)。还款意愿度等复杂画像后续迭代接入。次呼逻辑第一期沿用催收系统现有调度规则,AI侧仅负责单次通话流程处理,不引入额外复杂度。

四、系统架构(泰坦方案)

目标:用最小复杂度搭出可跑通、可评测、可追踪版本差异的系统8/6会议已确认采用泰坦方案——复用现有泰坦对话机器人架构承载对话,聚焦催收场景的配置适配、接口对接、评测体系构建,避免自研引擎的资源与周期风险。

泰坦方案 vs 自研方案(8/6会议决策依据)

维度泰坦方案 ✅(选定)自研agent方案 ❌(暂缓)
落地速度快(复用架构+配置适配,1周可出demo)慢(需自建对话引擎)
资源依赖少(主要依赖TTS并发,可腾讯云兜底)GPU卡资源紧张、无对应预算
风险泰坦上下文污染/差3个字符可用性问题 → 小流量灰度规避推进慢,无法响应9月上线诉求
定位短中期落地方案后续规划长期方案时再评估

4.1 架构总览

AI催收外呼项目架构(泰坦方案 · 第一期)话务接入层(现有能力复用)泰坦平台(核心承载)数据层评测层外呼调度(催收系统规则)ASR / TTS(自研8路→腾讯云兜底)转人工链路(现有话务系统)对话机器人(泰坦配置/话术包层)外部API查询节点(客户信息通话前组装)意图/话术逻辑(固定条件判断)合规敏感词扫描(嵌质检机器人·待确认)催收系统(案件/次呼调度/还款结果)C卡风险评分+还款意愿度通话记录(录音/ASR转写)离线评测集(全意图分支+AI跑测)AB分流(外层包层灰度切量)ASR效果校验(复用王欢能力)Badcase(自动捕捉+人工)第一期能力边界✅ 泰坦对话机器人+API查询节点✅ 固定条件判断(无宽限期权限)❌ 方言识别(后续讯飞)❌ 实时双工打断(后续迭代)⚠️ 泰坦上下文污染→小流量灰度规避实时转写查询案件/画像数据接口意图判断敏感词过滤合规话术(↓TTS)转人工信号回写分流策略

4.2 核心模块(泰坦方案落地)

① 话务接入层(现有能力复用,无额外改造)

模块职责本期策略
外呼调度号码池、频控、时段沿用催收系统现有次呼调度规则,由催收系统判断是否需要二次外呼,AI侧仅负责单次通话流程处理(避免引入额外复杂度)
ASR/TTS语音转写 / 文字转语音复用现有话务能力;TTS自研约8路并发(内呼10路),外呼并发待确认(预估3);不足时切换腾讯云TTS自动分流兜底;音色用易语婷(现有通用)
转人工链路转人工路由复用现有话务系统能力,无需额外改造(内呼侧已固定对接投诉与建议技能组)

② 泰坦平台(核心承载,配置为主)

模块职责本期实现方案
对话机器人 对话流程承载(对应3.1状态机) 基于泰坦对话机器人架构配置;外层包层做同话术分流灰度切量(AB测试载体)
外部API查询节点 通话中查询案件/画像/还款信息 通话前提前组装客户相关信息传入机器人上下文(案件数据/还款结果/C卡评分接口)
意图/话术逻辑 客户话语→意图→话术(对应3.2/3.3) 固定条件判断逻辑实现;本期无宽限期调整权限,靠规则规避模型幻觉风险
合规敏感词扫描 输出前合规检查(对应3.4) 泰坦扫敏感词嵌质检机器人——嵌机可行性待确认(8/6待办:确认现有质检机器人内嵌入另一机器人的可实现性与工作量)

③ 数据层(接口对接为主)

数据源说明本期对接方式
催收系统案件数据、次呼调度、还款结果回查业务侧正式向催收系统团队提需求,明确交付节点(见4.4确认清单)
C卡风险评分/还款意愿度画像驱动策略路由API查询节点通话前组装,先接入风险等级+金额+逾期天数
话术库版本管理的催收话术模板基于历史催收录音分析(8月第二周)+现有1-3天话术重构,支持版本管理
通话记录录音、ASR转写、对话日志泰坦侧通话全量记录,ASR转写用于评测校验

④ 评测层(核心新建)

模块职责本期实现方案
AB分流AI外呼 vs 人工外呼对比话务内部AB分流:外层包层同话术分流灰度切量;上线先小流量验证再逐步放量
离线评测引擎测试集跑测+指标计算覆盖全意图分支的标准测试集,AI跑测+人工评审;基于通话录音自动生成标注
ASR效果校验在线效果校验复用王欢的自动化评测能力,基于ASR识别结果完成效果校验
Badcase闭环自动捕捉+人工审核规则自动捕捉 + 人工抽检;持续优化对话逻辑(注意泰坦上下文污染问题)

⑤ 管理/运营(依托泰坦+业务侧)

模块职责本期策略
机器人配置权限话术/流程配置管理向刘哥申请线上部署的只读查看权限(无需编辑权限),便于相关人员查看机器人逻辑
话术维护话术模板更新与灰度泰坦配置+外层包层灰度切量,话术审核流程与业务侧对齐
审核工作台Badcase审核+标注待审核队列,标注问题类型和根因

4.3 数据流与接口

单通电话完整数据流(泰坦方案)

催收系统次呼调度 → 电话接通
  → 通话前:外部API查询节点组装客户信息
    (案件数据/还款结果回查/C卡风险评分 → 机器人上下文)
  → ASR实时转写客户语音
  → 泰坦对话机器人接收转写文本
  → 固定条件判断意图(文本 → 意图标签)
  → 话术匹配(状态×意图×施压等级 → 候选话术)
  → 合规敏感词扫描(候选话术 → 安全话术)
  → TTS合成语音 → 播放给客户
  → 循环至结束条件(承诺/转人工/轮次上限)
  → 结果回写催收系统

通话结束记录:
{
  call_id, duration, total_turns,
  outcome: 通话结果(承诺/拒绝/转人工/未接通),
  promise_amount, promise_date,
  transfer_reason: 转人工原因,
  compliance_flags: 合规标记,
  script_version: 话术版本,
  ab_group: AB分组
}

评测采集(复用王欢自动化评测能力):
  ASR转写文本 → 离线测试集跑测 / 在线ASR效果校验 / Badcase捕捉
⚠️ 已知平台限制(8/6会议确认):

MVP构建优先级(P0必须,P1建议)

优先级模块理由
P0对话管理器(FSM)对话骨架,没有它什么都跑不了
P0意图识别(规则版)不识别意图就无法选择话术
P0话术库(基础版)每个状态×意图至少1-2条话术
P0合规过滤器催收场景不可妥协的底线
P0转人工路由安全兜底机制
P0对话日志记录没有日志就无法评测
P1AB测试路由MVP可先用单一版本,但接口要预留
P1客户画像接入MVP可先用简单规则(如按时天数分档)
P1在线监控看板MVP可先用BI报表替代
P1Badcase自动捕捉MVP可先用人工抽检为主

4.4 技术栈确认清单(8/6会议后:大部分已确认)

✅ 已确认(8/6会议敲定)

#确认项结论
1对话承载方案泰坦对话机器人架构(复用),支持外部API查询节点
5外呼调度沿用催收系统现有次呼调度规则,AI侧只做单次通话
6转人工链路复用现有话务系统能力,无需额外改造
3TTS资源自研约8路并发,腾讯云TTS自动分流兜底,音色易语婷
8话术配置泰坦配置+外层包层同话术分流灰度切量
13评测能力复用王欢自动化评测能力,基于ASR识别结果校验
⚠️ 剩余待确认(未在8/6会议敲定,需跟进):

对话能力层(剩余)

#待确认项确认内容影响优先级若不可行的备选
2ASR能力边界 供应商?方言支持(本期不做方言,但需确认基础识别率)?催收高频词识别率? 意图识别输入 P0 方言后续依托讯飞;识别率低→置信度兜底+简化话术
4泰坦合规敏感词扫描 现有质检机器人内嵌另一机器人的可实现性?工作量?(8/6待办) 合规过滤 P0 不可行→泰坦外挂规则过滤

数据层(剩余)

#待确认项确认内容影响优先级若不可行的备选
9C卡风险评分接口 接口是否开放?粒度(客户级/案件级)?实时性?交付节点? 策略路由 P1 先按逾期天数+金额分档
10还款意愿度模型 上线状态?接口?输出字段?何时并入C卡体系? 策略路由 P1 正式版再接入
11催收系统接口 案件数据/还款结果回查/C卡评分等接口的交付时间节点(业务侧提需求) 对话引擎输入/修复率计算 P0 数据不全→话术变量降级为通用表述
14历史录音调取 历史催收录音(8月第二周分析用)获取方式、范围、脱敏? 话术框架/意图梳理 P0(8月第二周要用) 用现有已清洗数据集

合规与资源(剩余)

#待确认项确认内容影响优先级若不可行的备选
16合规红线+话术审核 业务侧提供:合规红线、敏感词、施压话术标准、意图分类规则(8/6明确由业务侧提供) 合规兜底 P0 先按通用催收规范+内部规则
7外呼线路报备 话术报备流程(IT刘岩)、模板(舒瑶);施压类话术涉及法律条文需提前报备 整体可行性 P0 阻塞项 优先温和施压表述
3b外呼TTS并发+音色 外呼TTS并发数确认(预估3,需核实);音色由业务方从多段录音中选定 TTS资源 P0 腾讯云TTS自动分流兜底
15验收指标口径 自然修复率/对话完成率/接通率统计口径与业务侧对齐,参考行业基准设定验收目标 评测体系 P0 先用方案内定义口径

4.5 可立即启动的工作(泰坦方案已定后)

8/6会议确认:多数项无争议,部分待单聊对齐——以下工作立即启动(不阻塞)

#工作项产出物对应会议待办
1话术资料归集还款日提醒+1-3天外呼话术文字版8/6纪要「整理AI催收全部话术文字版」
2历史录音分析对接青龙团队录音分析结论+优质坐席数据集清单8/6纪要「结合青龙团队录音分析结论」
3测试集构建(纯文本,零技术依赖)覆盖全意图分支的标准对话场景集(60+用例)
4合规红线梳理合规禁用词表+催收时间规则+话术审核流程文档8/6纪要「合规规则梳理」
5意图分类细化6类意图→子类+典型客户例句库(供NLU训练)
6施压话术起草L1-L2话术初稿(待法务审核)
7自然修复率基线确认D1-D7无催收手段下的修复率数据(业务方是否承接待确认)8/6纪要「确认业务方是否承接自然修复率工作」
8评测指标口径定义修复率/承诺率/客诉率的计算口径文档

这8项全是"写文档/整资料/建清单"类工作,不依赖任何技术栈确认,建议立即启动。

五、评测体系

评测体系是项目的"导航系统"——它告诉你当前效果如何、哪里有问题、优化方向在哪。分为离线评测(开发阶段)在线评测(上线阶段)两条线,通过Badcase闭环连接。8/6会议已明确:复用王欢的自动化评测能力,基于ASR识别结果完成效果校验,并提前准备评测集与AB测试分流能力。

⚠️ 泰坦平台评测风险:泰坦存在上下文污染问题(多轮对话上下文残留),离线跑测时需注意隔离;上线后通过小流量灰度验证效果,确认符合预期再逐步放量——这本身就是评测体系的"在线安全网"。
评测体系全景构造测试集(覆盖全意图分支的标准场景)标注验证集(优质坐席历史录音)AI跑测(自动指标计算)人工评审(双盲话术质量打分)输出评测报告(问题分类+优先级)AB分组(按逾期天数/金额/风险)AI组 vs 对照组(人工 or 不同AI版本)实时指标采集(修复率/承诺率/客诉率)统计显著性检验(样本量是否充足)版本效果对比(看板可视化)自动捕捉(合规违规/异常中断/意图连续失败)人工抽检(每日抽样听录音)分类标注(问题类型+根因)归因分析(话术/模型/数据)迭代优化→话术更新→验证)离线评测(开发阶段)在线评测(上线阶段)Badcase闭环

5.1 分层指标体系

指标分为三个层次:业务指标(决定项目是否成功)、对话指标(诊断对话质量)、合规指标(安全底线)。

第一层:业务指标(北极星)

指标定义计算方式目标行业基准参考
修复率(核心) AI外呼后X天内还款的客户占比 还款客户数 / 外呼客户数 MVP:不低于自然修复率(需与徐福珍确认基准值) 行业无统一公开基准(各机构内部数据),普遍表述"AI催收较人工提升数个百分点~十余个百分点"。唯一真值=对照组(自然/人工)相对提升,见6.4
承诺还款率 通话中承诺还款的客户占比 承诺客户数 / 接通客户数 反映AI催收的即时效果 行业未公开;经验区间视账龄而异,D4-D7通常30%-50%(📊 需用我方数据校准)
承诺兑现率 承诺后实际还款的客户占比 实际还款数 / 承诺客户数 反映话术有效性(承诺是否真实) 行业未公开;承诺兑现率过低(<40%)说明话术"空承诺"偏多,需调整(📊 经验区间)
客诉率 AI外呼引发的客诉占比 投诉数 / 外呼客户数 必须低于人工催收客诉率 硬性安全指标:目标0容忍,AB测试熔断阈值=基线的1.5倍

第二层:对话指标(诊断)

指标定义用途
意图识别准确率意图分类正确的占比(人工标注验证)诊断NLU模块质量
通话完成率正常结束(非异常中断)的通话占比诊断对话流程稳定性
平均对话轮次单通电话的平均对话轮数过短可能施压不足,过长可能陷入循环
转人工率触发转人工的通话占比过高→AI能力不足;过低→转人工阈值过严
话术命中率话术模板匹配成功的占比(vs兜底话术)命中率低→话术库覆盖不足
接通率电话成功接通的占比外呼策略效果(号码质量/时段策略)

第三层:合规指标(底线)

指标定义红线
合规违规次数质检发现的违规话术次数0容忍
禁用词命中率自动质检扫描到的禁用词出现率0容忍
时段违规率非合规时段外呼的占比0容忍
频次违规率超出频控规则的客户占比0容忍

5.2 离线评测

测试集构建

测试集是开发阶段的"模拟考试"。MVP阶段构造覆盖全意图分支的标准场景集

场景类型覆盖意图用例数(建议)数据来源
配合还款场景配合型10+坐席录音提取+人工编写
推脱拖延场景推脱型15+坐席录音提取(最常见)
否认质疑场景否认/质疑型10+Badcase历史+人工编写
协商请求场景协商型8+人工编写(含多种协商诉求)
情绪激动场景情绪型8+Badcase提取+人工编写
沉默/噪声场景无法识别5+人工模拟(方言/噪声/静音)
转人工触发场景投诉/法律/第三方5+人工编写(合规关键)

离线评测流程

  1. 自动跑测:AI引擎跑测试集,自动计算意图识别准确率、话术匹配率、状态流转正确率
  2. 人工评审:双盲评审AI输出的话术质量(合规性/自然度/施压力度/目标达成)
  3. 对比基线:与上一版本对比,量化改进/退步
  4. 输出报告:按场景类型×指标维度,标注问题优先级
  5. 版本冻结:通过评测门槛的版本冻结,进入AB测试
验证集构建(8/6会议明确):8月第二周完成历史催收录音分析——梳理全量对话意图、合规红线、话术框架,形成初步对话方案与业务侧对齐。录音分析结论同时用于:①构建验证集(对比AI话术与人工话术效果)②补充意图分类规则 ③沉淀话术框架。离线评测基于通话录音自动生成标注,收集badcase持续优化对话逻辑。

5.3 在线评测与AB测试

AB测试设计(8/6会议落地)

维度第一期方案
分流载体话务内部AB分流:泰坦外层包层做同话术分流灰度切量(同一话术不同版本/同一话术分流对比)
实验组AI外呼组(新话术版本)
对照组① 人工外呼组(对比AI vs人工效果差异)
② AI旧版本组(对比版本迭代效果)
效果校验复用王欢自动化评测能力,基于ASR识别结果完成效果校验(不依赖人工抽听全部录音)
分组维度按逾期天数(D4-5 vs D6-7)、金额档位、风险等级分层
放量节奏上线先小流量灰度(5%)→ 确认符合预期 → 逐步扩大(20%→50%→100%)
统计检验修复率差异的卡方检验/Z检验,显著性水平 α=0.05;每组≥200-300通接通电话
灰度风控:AB测试期间设置自动熔断机制——当客诉率超过阈值(如基线的1.5倍)、合规违规出现、修复率显著低于对照组时,自动暂停AI组外呼,回退到人工处理。

在线监控看板(MVP核心指标)

修复率(当日)
承诺率
转人工率
客诉率
接通率
平均轮次

↑ 示例看板指标卡片(实际数据接入后填充)

5.4 Badcase闭环

Badcase自动捕捉规则

捕捉类型触发规则优先级
合规违规信号禁用词命中 / 客户提及投诉 / 通话中异常情绪P0 立即
意图连续失败同一通电话连续3轮意图识别为"无法识别"P1
异常通话模式通话<10秒挂断 / 对话轮次>15轮 / 转人工率突增P1
承诺未兑现客户承诺还款但未实际还款(需T+1/T+3回溯)P2
修复失败AI外呼后客户仍未还款(需对比对照组)P2

Badcase处理流程

自动捕捉 / 人工抽检 → 进入审核队列
  → 人工审核(听录音+看转写+标注问题类型)
  → 归因分析:
     · 话术问题 → 修改话术模板
     · 意图识别问题 → 补充规则/模板
     · 合规问题 → 紧急下架+全量排查
     · 流程问题 → 调整FSM逻辑
     · 数据问题 → 补充画像维度
  → 修复后进入测试集(回归测试)
  → 验证通过 → 发布新版本 → AB测试验证
人工抽检策略:MVP阶段建议每日抽检比例 5%-10%(含AI外呼成功通话+转人工通话),重点抽检:转人工通话(100%)、异常通话(100%)、随机抽样(5%)。随着自动质检能力完善,人工抽检比例可逐步降低。

六、行业对标与基准(价值定位与成长Roadmap)

本章回答三个问题:行业龙头做到什么程度?我们在做一个多大难度/价值的事?我们的成长Roadmap对标行业什么水平?用于支撑管理层判断与评测基准设定。

6.1 行业全景与玩家地图

中国AI催收外呼市场经过 2018 年至今的发展,已形成三类玩家格局:

玩家类型代表机构模式特点成熟度
自研金融机构 度小满(2018年首发智能催收机器人)、马上消费金融、招联金融、奇富科技(360数科)、平安集团 自有客群+数据积累,AI催收嵌入贷后全流程,效果指标内部闭环 领先
技术服务商 金融壹账通(平安系)、科大讯飞、中关村科金、百融云创、追一科技、容联云、云蝠智能、度言软件 对外输出智能催收方案/平台,沉淀多机构语料与模板,按效果/按坐席收费 领先
外包催收机构转型 各类持牌催收公司自建AI外呼 人工为主、AI辅助,智能化程度参差 追赶中
行业演进时间线:2018-2020 萌芽期(通知型机器人,度小满2018年即亮相)→ 2021-2023 普及期(对话式AI外呼成为头部消金标配)→ 2024-2025 大模型期(LLM话术生成、策略引擎、全流程自动化)。对话式AI催收已是行业主流能力,但"做得好"的仍是少数头部。

6.2 龙头能力拆解(公开可查证)

① 金融壹账通(平安集团旗下)加马平台·智能催收

能力底座(官网公开):10万+催收语料、50+催收外呼流程模板、34套催收智能质检特色模型、1周可快速上线。

核心技术:意图识别→准确施压和促成→机器人串联升阶策略(根据每次拨打结果升阶不同机器人,构建催收递进式AI经营模式)→人机协同作业。

汽融机构案例(公开数据):

指标公开水平说明
作业效率比纯人工提升80%以上日外呼量1万+,月外呼量5万
ASR/NLU准确率85%语音识别+意图理解
逾期客户接通率高于45%逾期客群接通率(显著高于普通外呼)
对话完成率75%完整对话流程完成比例

来源:金融壹账通官网 ocft.com 智能催收方案页(2026年8月访问)。

② 度言软件(安米智能贷后管理系统)

方案架构(公开文章):数据整合 → 智能策略引擎 → 催收机器人+交互短信 → 案件自动流转 → BI分析。

关键能力:

来源:搜狐号「度言软件」2023年12月文章《打造AI自动化催收模式》——技术服务商视角的行业成熟方案形态。

③ 度小满(自研代表)

2018年百度开发者大会即展示智能催收机器人("您好,我是度小满金融智能客服…您现在的贷款已经逾期了,今天方便处理下吗?"),是行业先行者。依托百度大数据+强化学习,覆盖贷前/贷中/贷后全流程;后期升级大模型话术生成与策略决策。其AI催收长期作为公开案例被行业引用。

来源:机器人日报/DoNews 2018年7月报道;行业公开资料。

6.3 行业能力分层模型(L1-L4)

综合龙头公开能力,将行业AI催收能力划分为4个层级——这是衡量我们成长Roadmap的基准尺:

层级能力定义行业状态代表案例
L1 通知提醒型 单向话术播报:告知逾期事实+还款提醒,无交互 2018年已普及 度小满早期机器人
L2 对话式催收 多轮对话:意图识别、施压策略、协商锁定承诺、转人工兜底 行业主流(2023-2025) 金融壹账通加马平台
L3 智能策略型 画像驱动分案、机器人串联升阶、案件全流程自动流转、策略引擎 行业领先者 度言软件安米、壹账通升阶策略
L4 全自动智能催收 大模型自由对话、情绪识别、多模态、实时合规风控、跨渠道(语音+短信+企微) 头部探索中 各头部机构2025-2026方向

6.4 行业基准数据表(评测差距的标尺)

行业公开基准(可查证部分)

指标行业公开水平来源性质用途
作业效率提升80%+(vs 纯人工)✅ 厂商公开案例评估项目价值(我们会议纪要预期70-80%吻合)
ASR/NLU准确率85%✅ 厂商公开案例技术能力基准
逾期客户接通率>45%✅ 厂商公开案例外呼策略基准
对话完成率75%✅ 厂商公开案例对话质量基准
催收语料规模10万+条✅ 厂商公开数据积累目标
流程模板数50+套✅ 厂商公开话术体系目标
质检模型数34套✅ 厂商公开质检体系目标
修复率(催收后还款率)行业公开统一基准极少(各机构内部数据),普遍表述为"AI催收较人工提升数个百分点~十余个百分点"📊 行业报道区间用对照组相对提升衡量,不依赖绝对值
自然修复率(无催收)视客群/账龄差异极大,M1早期约20-35%(行业经验区间)📊 经验区间,需用我方数据确认AB测试基线对照组

标注说明:✅=厂商公开可查证;📊=行业报道/经验区间,需用我方数据实测校准。修复率是各机构核心商业机密,行业无统一公开基准——这也是我们必须自建对照组的根本原因。

8/6会议明确:需与业务侧对齐自然修复率、对话完成率、逾期客户接通率等核心指标的统计口径参考行业基准设定合理的验收目标(上表即参考基准来源)。同时需与催收侧统一数据统计口径。业务方是否承接自然修复率相关工作待确认。

6.5 我们的定位与差距分析

差距清单(vs 行业L2-L3水平)

能力维度行业龙头水平我们现状差距性质
催收语料10万+条(壹账通)0(有历史录音未清洗)🔴 需从录音+HR训练数据起步积累
话术/流程模板50+套(壹账通)手工设计FSM+基础话术🔴 需持续沉淀,AB测试驱动扩充
意图识别ASR/NLU 85%(壹账通)规则+模板起步(预计80%以下)🟡 先跑通再迭代模型
质检体系34套自动质检模型规则+人工抽检🟡 先人工后自动化
策略引擎分案+机器人串联升阶+自动流转(L3)单版本+人工分流🟢 正式版预留接口,Q4迭代
客户画像驱动风险评分+还款意愿+历史催收全量接入C卡+还款意愿度(已有,待接入)🟢 有基础数据优势
情绪识别头部L4探索中🟢 后置迭代项

🔴=短期需全力补;🟡=中期迭代;🟢=我们有基础/可后置。

6.6 难度与价值评估

我们在做一个多大难度/价值的事?

难度评估:中高难度(对话式催收是"戴着镣铐跳舞")

价值评估:高价值(战略级降本增效+合规管控)

结论:我们在做的是行业L2主流能力的0-1建设——技术路线成熟(不冒险),但落地执行有较高复杂度(合规+效果平衡)。对标行业,我们的目标不是"创新",而是用最短路径达到行业基准水平,再基于自有客群数据(车贷+车抵贷垂直场景)建立差异化。

6.7 行业基准 → 成长Roadmap(评测差距落地)

Roadmap 各阶段对标行业层级与基准指标

阶段时间目标能力对标行业层级关键基准指标(行业对标)
阶段0 现状 当前 D1-3 单向提醒 L1(2018年行业水平)
阶段1 MVP 8月底 D4-7 对话式催收跑通(结构完整) L2 起步 接通率≥30%→45%(行业>45%);对话完成率≥60%→75%(行业75%);ASR/NLU≥80%→85%
阶段2 正式版 9月中 D1-7 全周期 + 评测体系/AB测试 L2 完善 修复率 vs 对照组(自然/人工)相对提升为正且显著;客诉率≤人工;效率提升向80%靠拢
阶段3 迭代1 Q4 画像驱动策略路由、话术版本AB、Badcase闭环、质检模型起步 L3 部分 意图识别准确率≥85%;质检自动化覆盖率提升;语料积累向10万条靠拢
阶段4 迭代2 2027 Q1 机器人串联升阶、案件自动流转、策略引擎 L3 完善 接通率/完成率稳定达到行业基准;修复率相对提升持续为正
阶段5 探索 2027 全年 大模型自由对话、情绪识别、跨渠道协同 L4 探索 对标头部探索方向,自定评估
评测差距原则:评测体系中每个核心指标都应带行业基准参考值(见5.1指标表新增"行业基准"列)。目标设定遵循"先达标行业基准,再追求超越"——不追求一步到位,但每个迭代都向基准收敛。修复率无行业统一基准,以对照组相对提升为唯一真值。

七、用户未提及但重要的内容

以下是基于催收行业经验、会议纪要上下文和系统设计实践,补充的方案中必须考虑但需求描述中未明确提及的关键内容:

7.1 自然修复率基线(亟需确认)

会议纪要中提到"与徐福珍沟通无催收手段下的自然修复率"——这是整个项目的成败基准线。AI催收的修复率必须显著高于自然修复率才有价值。MVP上线前必须确认D4-D7的自然修复率基线数据。

建议:AB测试的对照组应包含一组"不催收"的基线组,用于同时验证AI催收 vs 人工催收 vs 不催收的效果差异。

7.2 ASR方言/口音适配

催收客户群体多样,方言和口音会严重影响ASR识别率,进而影响意图识别和对话流畅度。MVP阶段需评估:

风险:如果ASR识别率低于80%,对话体验会严重退化,导致修复率远低于预期。MVP阶段建议先用ASR识别置信度做兜底——置信度低时直接走简化话术或转人工。

7.3 呼叫策略优化(接通率)

接通率直接影响修复率的分母。催收场景的接通率通常远低于电销(客户故意不接陌生号码)。需考虑:

7.4 数据安全与隐私保护

7.5 冷启动与数据飞轮

MVP上线时没有线上对话数据,话术库和意图规则都依赖人工经验构建。需要设计数据飞轮机制让系统越用越好:

7.6 区域差异化合规

会议纪要提到"不同地区的催收时间限制、合规要求存在差异"。MVP阶段需要:

MVP简化:先按全国统一规则(8:00-21:00)上线,区域差异化作为正式版的迭代项。

7.7 知识库:产品/合同信息查询

客户可能询问具体的合同条款、利率、费用明细等问题。AI需要能准确回答:

风险:AI给出错误金额/日期信息可能引发客诉或法律风险。金额类信息必须走查询接口填充模板,不能走LLM自由生成。

7.8 还款渠道引导与确认

锁定承诺后的"临门一脚"——引导客户完成还款操作:

7.9 与现有1-3天外呼的衔接

D1-3的外呼策略和D4-7需要在以下方面保持一致或平滑过渡:

7.10 泰坦方案资源与合规约束(8/6会议新增)

7.11 项目人员角色表(两份纪要汇总)

人员角色本项目相关事项
毕总业务方高层/需求发起人提出9月上线1-7天对话式AI催收需求;携带初步方案赴上海沟通确认
徐福珍业务方对接人demo验收、项目节奏同步、自然修复率沟通、9月交付结论
徐步珍合作方(首次合作)对接策略:暂不主动交底、先探底需求再敲定细节
庆龙催收AI需求落地执行催收AI需求落地、录音分析结论、优质坐席数据集
王欢技术AI能力梳理、可行性评估;自动化评测能力复用(ASR效果校验)
吴刚质检系统归集/事项表质检系统统一归集、AI对话流程整理、事项表核对(AB/评测集/分流)
树祥内呼项目产品IVR调整需求邮件抄送对象、内呼项目产品负责人
王磊HR坐席模拟训练系统训练数据对接(对话样本补充)
小杰自研TTS负责人/对接核实TTS资源申请加卡;"孙伟鹏找他"事件核实
刘岩IT侧线路外呼线路话术报备
舒瑶报备模板电销话术报备历史Excel模板
舒强TTS需求汇总客服/催收TTS需求汇总对接自研TTS负责人
刘胜TTS并发核实TTS环节并发是否满足需求
刘哥机器人权限线上部署只读查看权限申请
吕良任务拆解单项任务拆解内容同步
李倩泰坦配置学习泰坦配置讲解录屏查看
文龙会议记录会议内容输入、录音AI合成整理
景涛/国兴/青龙相关方IVR调整邮件抄送、业务表合并、排期表同步
孙伟鹏提及人"孙伟鹏总找小杰施压"事件——信息混淆待核实

注:人名基于会议纪要AI转写,可能存在同音字差异(如徐福珍/徐步珍/徐步真),建议以实际通讯录为准。

八、会议纪要待办事项(8/6最新会议)

从8月6日最新会议纪要(AI呼入外呼及催收项目讨论)提取的待办,按主题归类。其中AI催收核心为本项目主线,其余为并行项目(内呼/企微通道)待办。

8.1 AI催收核心(本项目主线)

#待办事项负责人/关联人时间
1携带初步方案与毕总沟通,了解需求,评估现有方案可靠性项目组尽快
2向业务方同步电销AI通话demo,确认效果预期,同步项目推进节奏(暂不给明确交付时间)徐福珍8月7日
3历史催收录音分析:梳理全量对话意图、合规红线、话术框架,形成初步对话方案并与业务对齐项目组/业务侧8月第二周
4泰坦机器人配置+测试集构建+接口对接,启动内部联调自测泰坦/项目组8月第三周
5业务侧提供:历史催收录音、合规红线、意图分类规则、施压话术标准、敏感词清单业务侧待确认
6对齐验收指标口径:自然修复率、对话完成率、逾期客户接通率统计口径,参考行业基准设验收目标业务侧待确认
7确认业务方是否承接自然修复率相关工作,同步话术资料汇集、录音分析对接要求业务侧待确认
8协调催收系统接口:案件数据、还款结果回查、C卡风险评分等,明确交付节点催收系统团队业务侧提需求
9丰富事项表(与吴刚核对):补AB测试准备、评测集准备、话务内部AB分流准备吴刚/项目组近日
10向刘哥申请机器人线上部署只读查看权限(无需编辑权限)刘哥近日
11确认泰坦扫敏感词嵌质检机器人的可实现性与工作量泰坦/质检待确认
12确认外呼TTS并发数、音色,结合外呼推任务排队场景核实参数刘胜/舒强待确认
13线路报备:咨询舒瑶报备要求(历史Excel模板),提供AI并发信息及机器人ID,话术确认后启动报备IT刘岩/舒瑶话术确认后
14整理对话录音发送给泰坦(示例),同步项目大节奏,明确上线先切小量、逐步扩量模式项目组次日
15泰坦配置讲解录屏,供李倩查看泰坦配置时

8.2 并行项目:企微通道

#待办事项关联人
16梳理内外部4个群人员信息,确认拉群人员是否固定,用于一心企微应用权限开通业务侧
17整理企微开号操作步骤图片资料,交付业务方按流程开号
18确认新主体配置信息(可发消息的新主体+企微挂载全部配置)并补充
19提供新号信息(手机号/企微名称/userid),开通测试环境企微ID
20将吕良的任务拆解内容发群,便于各方准备吕良
21与说话人1沟通测试环境双主体具体安排说话人1

8.3 并行项目:内呼 + 三方沟通

#待办事项关联人
22今日通知武汉CSP相关人员,明日下午4点三方沟通会(CSP业务/技术),同步AI转接记录字段、接口需求,提前建微信沟通群CSP
23IVR节点调整需求文档正式发邮件(抄送树祥、国兴、吴刚、景涛)树祥/景涛
24替刘胜核实TTS环节并发是否满足需求,确认参数配置刘胜
25次日上午与徐福珍同步:电销事项、下周工作安排、demo验收结果、9月交付结论徐福珍
26文龙输入完成后发群共同确认内容文龙
27记录一版当前讨论内容,后续录音交AI合成,梳理需完成事项及材料

九、里程碑与时间线(8/6最新节奏)

基于8/6会议明确的推进节奏。每个阶段对应的行业能力层级与基准指标6.7 行业基准→成长Roadmap

8月7日(明日)
🎬 向业务侧同步电销AI通话demo
  • 确认效果预期(会议已演示汽车金融电销流程,暴露承接打断能力不足→配套话术弥补)
  • 同步项目整体推进节奏、资源需求(暂不承诺明确交付时间,避免被动)
  • 首次合作方徐步珍:暂不主动交底,下周二前仅提供大致节奏计划,先探底毕总想法再敲定细节
8月第二周(8/10-8/16)
🎙️ 历史录音分析 + 对话方案
  • 完成历史催收录音分析:梳理全量对话意图、合规红线、话术框架
  • 形成初步对话方案,与业务侧完成对齐确认
  • 业务侧提供:合规红线/敏感词/意图分类规则/施压话术标准
8月第三周(8/17-8/23)
⚙️ 泰坦配置 + 评测集 + 接口对接
  • 泰坦机器人配置(话术包层分流)、测试集构建、接口对接(案件/还款/C卡)
  • 启动内部联调与自测;协调各配合方完成资源准备(TTS/线路报备)
  • 并行:通道侧8/20-21完成技术准备,满足联调接入条件
9月上旬(9/1-9/10)
🚀 全流程测试 + 验收 + 小流量灰度
  • 完成全流程测试与业务侧验收(验收口径对齐:自然修复率/对话完成率/接通率)
  • 启动小流量灰度(先切小量验证,确认符合预期再逐步扩量)
  • 并行:客服侧9月3日版本上线
9月中旬
✅ 正式版本全量上线
  • D1-7 全周期AI催收(D1-3提醒型 + D4-7对话型),根据灰度效果调整放量规模
  • AB测试持续运行,Badcase闭环迭代话术
⚠️ 节奏策略提醒(8/6会议共识):

AI催收外呼项目方案 · D1-D10对话式催收MVP

编制日期:2026年8月6日 · 基于8月5日/6日会议纪要