AI催收外呼项目方案

D1-D10 逾期客户对话式催收 · MVP版本 · 2026年8月6日

⚠️ 合规第一原则:催收场景合规敏感度极高(7月末扫黑行动后监管进一步趋严)。所有设计遵循"宁可交互效果保守,不得触碰监管红线"。第一期采用保守方案,先跑通结构再优化效果。

一、项目背景与目标

1.1 业务背景

现状:当前AI外呼仅覆盖 D1-D3 逾期客户的单向提醒通知,无需响应客户交互。D4-D10 阶段客户还款意愿下降,完全依赖人工催收坐席跟进。

痛点:1-10天逾期用户占比最高,催收人力投入巨大。延长AI外呼覆盖周期预计可降低 70%-80% 的人工工作量,同时AI话术输出相比人工更规范、合规风险更低。

团队背景:我部门刚接手催收AI业务线,原算法leader转为合作方。团队具备AI话务基础能力(电销场景对话式AI已落地),但无催收外呼实操经验。

1.2 项目目标

维度目标说明
MVP 8月底前跑通 D4-D7 对话式催收 结构完整(状态机+意图+施压+合规+转人工),效果可差但结构要全
正式版 9月中旬上线 D1-D7 全周期 D1-3保持现有提醒逻辑,D4-7对话式施压,D8+转人工
评测体系 支撑灰度AB上线的全链路评测 离线测试集/验证集 + 在线指标监控 + Badcase捕捉闭环
长期 D8-D10 强压型 + 情绪识别 后续扩展更强施压策略、客户情绪识别、区域差异化适配
核心评价指标:客户修复率(Recovery Rate)。配套指标包括:承诺还款率、实际还款率、客诉率、转人工率、通话完成率。

1.3 核心约束

合规红线(不可逾越)

技术约束

二、逾期阶段×AI能力分层

逾期阶段 × AI能力分层设计D1-D3提醒通知型D4-D7对话施压型D8-D10强压升级型现有能力(保留)单向话术播报告知逾期事实+提醒无需客户交互★ MVP核心对话式交互意图识别+动态施压协商+承诺锁定转人工兜底正式版扩展更强施压策略法律后果告知转人工准备MVP目标D4-7 对话式催收跑通所有核心结构就位效果可差,结构要全升级升级

根据逾期天数递增、客户还款意愿递减的特征,将AI催收能力分为三个阶段:

阶段逾期天数AI能力对话深度施压等级本期覆盖
提醒通知型 D1-D3 单向话术播报 无交互 已有
对话施压型 D4-D7 对话式交互+动态施压 意图识别→施压探因→承诺锁定 中(告知后果→道德施压) MVP核心
强压升级型 D8-D10 更强施压+法律后果告知 升级话术+转人工预备 高(法律后果→信用影响) 正式版
MVP聚焦:D4-D7 对话施压型。这是从"通知"到"催收"的关键跃迁——AI需要能听懂客户说什么、判断客户意图、选择合适话术回应、动态调整施压策略,并在必要时转人工。所有核心结构在MVP中必须就位。

三、对话框架设计(核心)

这是整个项目的核心——定义AI如何与逾期客户对话。目标是用最低复杂度跑通完整对话闭环,同时确保所有重要能力结构就位。

3.1 对话状态机

MVP采用有限状态机(FSM)驱动对话流程,而非自由生成式对话。FSM的核心优势:可控、可测试、可评测——每个状态、每条边都可以构造测试用例。

AI催收对话状态机(D4-D7 施压型)路由分支协商处理安抚转人工合规底线禁止威胁/辱骂/恐吓禁止透露债务给第三方禁止虚假承诺转人工硬触发• 客户要求人工• 提及投诉/法律/媒体• 合规风险信号开场白身份核验逾期告知告知逾期事实金额/天数/后果施压探因施压话术(梯度递进)探因提问(开放+引导)锁定承诺确认还款时间+金额提供还款渠道事实核实核实合同信息重申法律义务兜底重述换角度重述最多3轮结束语总结+后续动作告知+还款提醒转人工触发转人工传递上下文确认本人推脱型(找理由)配合型(承诺还款)否认/质疑型协商型(延期/分期/减免)情绪型(愤怒/哭泣)沉默/无法识别核实完毕权限内方案超出权限情绪平复情绪失控连续3轮失败

状态流转说明

状态触发条件AI动作退出条件
开场白 电话接通 身份核验(确认本人)→ 表明来意 确认本人
逾期告知 身份确认完成 告知逾期事实:金额、天数、还款截止日 客户已知晓
施压探因 告知完成 梯度施压话术 + 开放式探因提问 客户意图明确
意图响应 意图识别完成 按意图类型匹配响应策略(见3.2) 达成承诺 / 需转人工
锁定承诺 客户承诺还款 确认还款时间+金额,提供还款渠道指引 承诺记录完毕
结束语 对话目标达成 / 上限轮次 总结+后续动作告知+还款提醒 挂断
转人工 触发转人工条件(见3.5) 传递上下文摘要给人工坐席 坐席接管
轮次上限设计:MVP设定单通电话最多 8-10轮对话(不含开场白),防止AI陷入无效循环。到达上限后执行结束语+后续跟进告知,挂断后标记为"需人工跟进"。

3.2 客户意图分类体系

意图识别是对话引擎的"大脑"。MVP阶段定义6类核心意图+ 转人工信号,覆盖催收场景的主要客户反应模式:

意图类型客户表现AI响应策略转人工?
配合型 "我知道了,马上还"/"我明天还" → 锁定承诺:确认时间+金额,提供还款渠道,温和提醒
推脱型 "我这几天没钱"/"工资还没发"/"再等等" → 施压升级:理解困难但重申义务,给出短期方案(如分期首付款),施压梯度+1 否(≤2轮后升级)
否认/质疑型 "我没借过"/"金额不对"/"你们是骗子吧" → 事实核实:核实合同信息、借款金额、还款记录,重申法律义务 连续2轮仍否认→转人工
协商型 "能不能延期"/"能不能分期"/"能不能减免" → 权限判断:MVP仅支持标准化方案(如约定3日内还款),超出权限→转人工 超出AI权限→转人工
情绪型 愤怒/哭泣/焦虑/情绪失控 → 安抚降级:共情+安抚,尝试回到理性沟通;情绪失控→立即转人工 情绪失控→转人工
沉默/无法识别 不说话 / 语音质量差 / 方言无法识别 → 兜底重述:换角度重述逾期事实,提示客户可以说话 连续3轮失败→转人工

转人工硬触发信号(任何状态立即触发)

3.3 施压梯度设计

催收的本质是施压(会议纪要原话:"催收它是施压,你施的对不对,说的对不对")。AI需要根据客户反应动态调整施压等级

施压等级策略话术方向适用场景合规检查
L1 温和提醒 善意告知 "您的XX贷款已逾期X天,欠款XX元,请您尽快安排还款" 开场、配合型客户 ✓ 标准
L2 道义施压 信用后果 "逾期记录将上报征信系统,影响您未来的贷款和信用卡申请" 推脱型客户 ✓ 需确认表述准确
L3 事实施压 法律义务 "根据合同约定,您有义务按时还款,逾期将产生滞纳金/罚息" 连续推脱、否认型 ⚠️ 需法务审核话术
L4 升级预警 后续措施 "如继续逾期,案件将移交后续催收流程,届时将有专人跟进" D6-7、多次推脱 ⚠️ 不得夸大后果
施压红线:施压话术必须经过法务/合规审核后方可入库。MVP阶段建议先用 L1-L2 为主,L3-L4 作为兜底预备但需审核后再启用。所有施压话术禁止:虚构法律后果、夸大处罚措施、使用威胁性措辞。

3.4 合规兜底框架

三层合规防线

第一层:话术入库审核

第二层:实时合规过滤

第三层:事后质检审计

3.5 转人工机制

转人工的完整链路

环节说明MVP实现
触发判定满足硬触发条件或软触发阈值规则引擎(见3.2转人工信号)
上下文摘要向人工坐席传递对话上下文结构化摘要:客户意图、施压等级、对话轮次、关键信息点
平滑过渡AI告知客户即将转接"好的,我帮您转接专员处理,请稍等"
坐席接管人工坐席查看上下文后继续对话CRM工单+对话摘要推送到坐席工作台
结果回写记录转人工原因+处理结果回写催收CRM,标注转人工类型

3.6 客户画像驱动的策略路由

根据会议纪要,公司已有 C卡风险评分体系还款意愿度模型(已测试,计划并入C卡)。MVP应利用这些数据做对话前的策略路由:

画像维度数据来源对话策略影响
风险等级(C卡)现有C卡评分高风险→施压起始等级更高;低风险→从L1开始
还款意愿度意愿度模型输出低意愿→更早进入施压探因;高意愿→温和引导即可
历史催收记录CRM系统多次承诺未还→施压升级;首次逾期→温和提醒
逾期金额/天数案件系统金额大/天数多→施压等级更高
产品类型案件系统消费贷 vs 车抵贷→话术框架微调(车抵贷可提及抵押物)
MVP简化方案:第一期仅接入逾期天数+金额+风险等级3个维度做简单路由(如分2-3档)。还款意愿度等复杂画像后续迭代接入。关键是路由接口要预留好,后续加维度不改架构。

四、MVP系统架构

目标:用最小复杂度搭出可跑通、可评测、可追踪版本差异的系统。复用现有AI话务底层能力,聚焦催收场景专属模块。

4.1 架构总览

AI催收外呼 MVP 系统架构接入层对话引擎数据层评测层管理后台外呼调度(号码池/频控/时段)ASR/TTS(复用现有话务能力)通话控制(转人工/挂断/重呼)对话管理器(状态机/上下文)意图识别(NLU/分类)话术选择(场景匹配/模板)合规过滤器(兜底/红线拦截)客户画像(风险等级/还款意愿)话术库(版本管理)通话记录(录音/转写)催收CRM(案件/工单)离线评测(测试集/验证集)在线监控(实时指标看板)AB测试路由(分组/对比/统计)Badcase引擎(自动捕捉+人工)策略配置话术编辑审核工作台实时转写客户话语意图标签候选话术合规话术(↓TTS)转人工信号客户信息话术模板写入对话回写结果路由策略(↑)数据实时自动扫描待审核

4.2 核心模块

① 接入层(复用现有能力)

模块职责MVP策略
外呼调度号码池管理、呼叫频控、时段控制复用现有外呼平台,增加催收场景的频控规则(单客户每日≤2次,间隔≥4小时,时段8:00-21:00)
ASR/TTS语音转写 / 文字转语音复用现有话务ASR/TTS能力,重点优化催收高频词汇识别率
通话控制转人工、挂断、重呼、录音新增催收场景的转人工路由逻辑

② 对话引擎(核心新建)

模块职责MVP实现方案
对话管理器(DM) 状态机驱动、上下文管理、轮次控制 基于FSM实现(见3.1),维护对话状态、历史轮次、客户画像缓存
意图识别(NLU) 客户话语→意图分类 MVP用规则+模板匹配(关键词+句式模式)为主,后续迭代引入模型分类
话术选择 意图→话术模板匹配+变量填充 话术库按(状态×意图×施压等级)索引,模板填充客户信息变量
合规过滤器 输出前合规检查+兜底替换 关键词黑名单+规则引擎(见3.4),MVP用正则匹配为主

③ 数据层

数据源说明MVP数据来源
客户画像风险等级、还款意愿、历史催收对接C卡评分+CRM案件信息
话术库版本管理的催收话术模板基于现有1-3天话术+坐席录音分析重构,支持版本管理
通话记录录音、转写文本、对话日志每通电话全量记录(状态轨迹、意图识别结果、话术版本、施压等级)
催收CRM案件状态、还款结果、工单对接现有催收CRM,回写AI外呼结果

④ 评测层(核心新建)

模块职责MVP实现方案
AB测试路由按策略分组客户到不同话术版本基于案件ID哈希分组,支持多版本并行对比
离线评测引擎测试集自动跑测+指标计算构造标准场景测试集,自动计算意图识别准确率、话术匹配率等
在线监控看板实时指标采集+可视化修复率、承诺率、客诉率、转人工率等核心指标实时展示
Badcase引擎自动捕捉异常+人工审核规则自动捕捉(合规违规信号/异常中断/连续失败)+ 人工抽检

⑤ 管理后台

模块职责MVP策略
策略配置施压等级、轮次上限、转人工阈值可视化配置界面,支持热更新
话术编辑话术模板CRUD+版本管理支持话术模板新增/编辑/审核/上下架
审核工作台Badcase审核+标注+归因待审核队列,支持标注问题类型和根因

4.3 数据流与接口

单通电话完整数据流

外呼调度 → 电话接通
  → ASR实时转写客户语音
  → 对话管理器接收转写文本
  → 意图识别(文本 → 意图标签)
  → 话术选择(状态×意图×施压等级 → 候选话术)
  → 合规过滤(候选话术 → 安全话术)
  → TTS合成语音 → 播放给客户
  → 循环至结束条件(承诺/转人工/轮次上限)

每轮对话写入日志:
{
  call_id, timestamp, turn_num,
  state: 当前FSM状态,
  customer_text: ASR转写,
  intent: 识别意图,
  intent_confidence: 置信度,
  response_template_id: 话术模板ID,
  response_version: 话术版本,
  pressure_level: 施压等级,
  compliance_check: 合规检查结果,
  ab_group: AB分组
}

通话结束写入:
{
  call_id, duration, total_turns,
  outcome: 通话结果(承诺/拒绝/转人工/未接通),
  promise_amount, promise_date,
  transfer_reason: 转人工原因,
  compliance_flags: 合规标记,
  script_version: 话术版本,
  ab_group: AB分组
}

MVP构建优先级(P0必须,P1建议)

优先级模块理由
P0对话管理器(FSM)对话骨架,没有它什么都跑不了
P0意图识别(规则版)不识别意图就无法选择话术
P0话术库(基础版)每个状态×意图至少1-2条话术
P0合规过滤器催收场景不可妥协的底线
P0转人工路由安全兜底机制
P0对话日志记录没有日志就无法评测
P1AB测试路由MVP可先用单一版本,但接口要预留
P1客户画像接入MVP可先用简单规则(如按时天数分档)
P1在线监控看板MVP可先用BI报表替代
P1Badcase自动捕捉MVP可先用人工抽检为主

4.4 技术栈确认清单(需与王欢/庆龙对齐)

⚠️ 设计前提:本方案中多处模块的实现方式取决于底层技术栈(现有话务平台能力、LLM可用性、数据接口等)。以下17项为待确认清单,建议带着清单与王欢(技术)、庆龙(执行)逐项对齐后再冻结架构。P0=阻塞架构定稿;P1=影响实现方式;P2=影响迭代节奏。

对话能力层

#待确认项确认内容影响模块优先级若不可行的备选
1现有电销对话式AI架构 底层是FSM/规则/LLM编排?对话管理能力能否直接复用? 对话管理器 P0 可复用→做催收适配层;否则自建FSM
2ASR能力边界 供应商?方言支持范围?实时转写延迟?催收高频词(还款/逾期/利息)识别率? 意图识别输入 P0 方言弱→识别置信度兜底+简化话术+转人工
3TTS能力 供应商?音色是否适合催收场景?支持变量话术拼接? 话术播报 P1 现有音色先用,后续优化
4内部LLM可用性(泰坦等) 是否有内部大模型可用于意图识别/话术生成?接口、成本、延迟? 意图识别方案 P0 有LLM→意图分类+话术生成;无→规则+模板先行

呼叫平台层

#待确认项确认内容影响模块优先级若不可行的备选
5外呼平台能力边界 是否支持:频控规则、时段控制、号码池管理、录音、实时转写? 外呼调度/通话控制 P0 缺能力→外接组件或在平台外层实现
6转人工链路 是否支持通话中转人工?三方转接还是挂断重拨?坐席如何接管?上下文如何传递? 转人工路由 P0 不支持三方→AI摘要+挂断后坐席回拨
7外呼线路资质 催收场景外呼线路是否合规?自有/外采线路是否允许催收外呼? 整体可行性 P0 阻塞项 线路不合规→项目需重新评估
8现有1-3天外呼实现细节 话术如何配置?日志格式?能否在同平台上扩展? 话术库/D1-3衔接 P0 无法扩展→D4-7独立实现,D1-3保持原样

数据层

#待确认项确认内容影响模块优先级若不可行的备选
9C卡风险评分接口 接口是否开放?粒度(客户级/案件级)?实时性? 策略路由 P1 MVP先用逾期天数+金额分档
10还款意愿度模型 上线状态?接口?输出字段?何时并入C卡体系? 策略路由 P1 未上线→正式版再接入
11CRM案件数据 逾期天数/金额/还款计划/联系人信息的可获取性? 对话引擎输入 P0 数据不全→话术变量降级为通用表述
12还款结果回查接口 T+N还款结果能否查到?(修复率计算依赖此数据) 评测体系(核心指标) P0 无接口→人工从催收系统导数据(降频统计)
13BI录音调取 按优秀坐席/修复客户标签批量调取录音是否可行? 验证集构建 P1 不可行→用现有已清洗数据集
14HR模拟训练系统数据 数据结构?调取范围?脱敏要求?(王磊负责) 训练数据补充 P1 不可调取→仅用录音数据

合规与平台

#待确认项确认内容影响模块优先级若不可行的备选
15泰坦平台定位 是否作为承载平台?质检系统归集到吴刚处的时间线?适配层方案? 平台架构 P1 不在泰坦承载→独立部署
16合规审核流程 法务/合规接口人是谁?话术审核流程?各区域催收时间规则库? 合规兜底 P0 无规则库→先按全国统一8:00-21:00
17还款渠道清单 客户可通过哪些渠道还款(App/公众号/转账)?话术能否准确引导? 还款引导 P1 渠道少→话术只给App指引+短信

4.5 技术栈无关、可立即启动的工作

与王欢/庆龙对齐期间,团队可并行推进(不阻塞)

#工作项产出物对应会议待办
1话术资料归集还款日提醒+1-3天外呼话术文字版8/6纪要「整理AI催收全部话术文字版」
2历史录音分析对接青龙团队录音分析结论+优质坐席数据集清单8/6纪要「结合青龙团队录音分析结论」
3测试集构建(纯文本,零技术依赖)覆盖全意图分支的标准对话场景集(60+用例)
4合规红线梳理合规禁用词表+催收时间规则+话术审核流程文档8/6纪要「合规规则梳理」
5意图分类细化6类意图→子类+典型客户例句库(供NLU训练)
6施压话术起草L1-L2话术初稿(待法务审核)
7自然修复率基线确认D4-D7无催收手段下的修复率数据8/5纪要「与徐福珍沟通自然修复率」
8评测指标口径定义修复率/承诺率/客诉率的计算口径文档

这8项全是"写文档/整资料/建清单"类工作,不依赖任何技术栈确认,建议立即启动。

五、评测体系

评测体系是项目的"导航系统"——它告诉你当前效果如何、哪里有问题、优化方向在哪。分为离线评测(开发阶段)在线评测(上线阶段)两条线,通过Badcase闭环连接。

评测体系全景构造测试集(覆盖全意图分支的标准场景)标注验证集(优质坐席历史录音)AI跑测(自动指标计算)人工评审(双盲话术质量打分)输出评测报告(问题分类+优先级)AB分组(按逾期天数/金额/风险)AI组 vs 对照组(人工 or 不同AI版本)实时指标采集(修复率/承诺率/客诉率)统计显著性检验(样本量是否充足)版本效果对比(看板可视化)自动捕捉(合规违规/异常中断/意图连续失败)人工抽检(每日抽样听录音)分类标注(问题类型+根因)归因分析(话术/模型/数据)迭代优化→话术更新→验证)离线评测(开发阶段)在线评测(上线阶段)Badcase闭环

5.1 分层指标体系

指标分为三个层次:业务指标(决定项目是否成功)、对话指标(诊断对话质量)、合规指标(安全底线)。

第一层:业务指标(北极星)

指标定义计算方式目标行业基准参考
修复率(核心) AI外呼后X天内还款的客户占比 还款客户数 / 外呼客户数 MVP:不低于自然修复率(需与徐福珍确认基准值) 行业无统一公开基准(各机构内部数据),普遍表述"AI催收较人工提升数个百分点~十余个百分点"。唯一真值=对照组(自然/人工)相对提升,见6.4
承诺还款率 通话中承诺还款的客户占比 承诺客户数 / 接通客户数 反映AI催收的即时效果 行业未公开;经验区间视账龄而异,D4-D7通常30%-50%(📊 需用我方数据校准)
承诺兑现率 承诺后实际还款的客户占比 实际还款数 / 承诺客户数 反映话术有效性(承诺是否真实) 行业未公开;承诺兑现率过低(<40%)说明话术"空承诺"偏多,需调整(📊 经验区间)
客诉率 AI外呼引发的客诉占比 投诉数 / 外呼客户数 必须低于人工催收客诉率 硬性安全指标:目标0容忍,AB测试熔断阈值=基线的1.5倍

第二层:对话指标(诊断)

指标定义用途
意图识别准确率意图分类正确的占比(人工标注验证)诊断NLU模块质量
通话完成率正常结束(非异常中断)的通话占比诊断对话流程稳定性
平均对话轮次单通电话的平均对话轮数过短可能施压不足,过长可能陷入循环
转人工率触发转人工的通话占比过高→AI能力不足;过低→转人工阈值过严
话术命中率话术模板匹配成功的占比(vs兜底话术)命中率低→话术库覆盖不足
接通率电话成功接通的占比外呼策略效果(号码质量/时段策略)

第三层:合规指标(底线)

指标定义红线
合规违规次数质检发现的违规话术次数0容忍
禁用词命中率自动质检扫描到的禁用词出现率0容忍
时段违规率非合规时段外呼的占比0容忍
频次违规率超出频控规则的客户占比0容忍

5.2 离线评测

测试集构建

测试集是开发阶段的"模拟考试"。MVP阶段构造覆盖全意图分支的标准场景集

场景类型覆盖意图用例数(建议)数据来源
配合还款场景配合型10+坐席录音提取+人工编写
推脱拖延场景推脱型15+坐席录音提取(最常见)
否认质疑场景否认/质疑型10+Badcase历史+人工编写
协商请求场景协商型8+人工编写(含多种协商诉求)
情绪激动场景情绪型8+Badcase提取+人工编写
沉默/噪声场景无法识别5+人工模拟(方言/噪声/静音)
转人工触发场景投诉/法律/第三方5+人工编写(合规关键)

离线评测流程

  1. 自动跑测:AI引擎跑测试集,自动计算意图识别准确率、话术匹配率、状态流转正确率
  2. 人工评审:双盲评审AI输出的话术质量(合规性/自然度/施压力度/目标达成)
  3. 对比基线:与上一版本对比,量化改进/退步
  4. 输出报告:按场景类型×指标维度,标注问题优先级
  5. 版本冻结:通过评测门槛的版本冻结,进入AB测试
验证集构建:利用会议纪要提到的资源——优质坐席历史录音(BI系统按优秀坐席+修复客户标签调取)+ HR坐席模拟训练系统数据(王磊负责)。这些录音经清洗后可作为验证集,对比AI话术与人工话术的效果差异。

5.3 在线评测与AB测试

AB测试设计

维度MVP方案
分组方式按案件ID哈希分组,确保分组随机性
实验组AI外呼组(新话术版本)
对照组① 人工催收组(对比AI vs人工效果)
② AI旧版本组(对比版本迭代效果)
分组维度按逾期天数(D4-5 vs D6-7)、金额档位、风险等级分层
样本量MVP阶段需计算最小显著样本量(建议每组≥200-300通接通电话)
统计检验修复率差异的卡方检验/Z检验,显著性水平 α=0.05
放量节奏5% → 20% → 50% → 100%,每档观察3-5天无异常再放量
灰度风控:AB测试期间设置自动熔断机制——当客诉率超过阈值(如基线的1.5倍)、合规违规出现、修复率显著低于对照组时,自动暂停AI组外呼,回退到人工处理。

在线监控看板(MVP核心指标)

修复率(当日)
承诺率
转人工率
客诉率
接通率
平均轮次

↑ 示例看板指标卡片(实际数据接入后填充)

5.4 Badcase闭环

Badcase自动捕捉规则

捕捉类型触发规则优先级
合规违规信号禁用词命中 / 客户提及投诉 / 通话中异常情绪P0 立即
意图连续失败同一通电话连续3轮意图识别为"无法识别"P1
异常通话模式通话<10秒挂断 / 对话轮次>15轮 / 转人工率突增P1
承诺未兑现客户承诺还款但未实际还款(需T+1/T+3回溯)P2
修复失败AI外呼后客户仍未还款(需对比对照组)P2

Badcase处理流程

自动捕捉 / 人工抽检 → 进入审核队列
  → 人工审核(听录音+看转写+标注问题类型)
  → 归因分析:
     · 话术问题 → 修改话术模板
     · 意图识别问题 → 补充规则/模板
     · 合规问题 → 紧急下架+全量排查
     · 流程问题 → 调整FSM逻辑
     · 数据问题 → 补充画像维度
  → 修复后进入测试集(回归测试)
  → 验证通过 → 发布新版本 → AB测试验证
人工抽检策略:MVP阶段建议每日抽检比例 5%-10%(含AI外呼成功通话+转人工通话),重点抽检:转人工通话(100%)、异常通话(100%)、随机抽样(5%)。随着自动质检能力完善,人工抽检比例可逐步降低。

六、行业对标与基准(价值定位与成长Roadmap)

本章回答三个问题:行业龙头做到什么程度?我们在做一个多大难度/价值的事?我们的成长Roadmap对标行业什么水平?用于支撑管理层判断与评测基准设定。

6.1 行业全景与玩家地图

中国AI催收外呼市场经过 2018 年至今的发展,已形成三类玩家格局:

玩家类型代表机构模式特点成熟度
自研金融机构 度小满(2018年首发智能催收机器人)、马上消费金融、招联金融、奇富科技(360数科)、平安集团 自有客群+数据积累,AI催收嵌入贷后全流程,效果指标内部闭环 领先
技术服务商 金融壹账通(平安系)、科大讯飞、中关村科金、百融云创、追一科技、容联云、云蝠智能、度言软件 对外输出智能催收方案/平台,沉淀多机构语料与模板,按效果/按坐席收费 领先
外包催收机构转型 各类持牌催收公司自建AI外呼 人工为主、AI辅助,智能化程度参差 追赶中
行业演进时间线:2018-2020 萌芽期(通知型机器人,度小满2018年即亮相)→ 2021-2023 普及期(对话式AI外呼成为头部消金标配)→ 2024-2025 大模型期(LLM话术生成、策略引擎、全流程自动化)。对话式AI催收已是行业主流能力,但"做得好"的仍是少数头部。

6.2 龙头能力拆解(公开可查证)

① 金融壹账通(平安集团旗下)加马平台·智能催收

能力底座(官网公开):10万+催收语料、50+催收外呼流程模板、34套催收智能质检特色模型、1周可快速上线。

核心技术:意图识别→准确施压和促成→机器人串联升阶策略(根据每次拨打结果升阶不同机器人,构建催收递进式AI经营模式)→人机协同作业。

汽融机构案例(公开数据):

指标公开水平说明
作业效率比纯人工提升80%以上日外呼量1万+,月外呼量5万
ASR/NLU准确率85%语音识别+意图理解
逾期客户接通率高于45%逾期客群接通率(显著高于普通外呼)
对话完成率75%完整对话流程完成比例

来源:金融壹账通官网 ocft.com 智能催收方案页(2026年8月访问)。

② 度言软件(安米智能贷后管理系统)

方案架构(公开文章):数据整合 → 智能策略引擎 → 催收机器人+交互短信 → 案件自动流转 → BI分析。

关键能力:

来源:搜狐号「度言软件」2023年12月文章《打造AI自动化催收模式》——技术服务商视角的行业成熟方案形态。

③ 度小满(自研代表)

2018年百度开发者大会即展示智能催收机器人("您好,我是度小满金融智能客服…您现在的贷款已经逾期了,今天方便处理下吗?"),是行业先行者。依托百度大数据+强化学习,覆盖贷前/贷中/贷后全流程;后期升级大模型话术生成与策略决策。其AI催收长期作为公开案例被行业引用。

来源:机器人日报/DoNews 2018年7月报道;行业公开资料。

6.3 行业能力分层模型(L1-L4)

综合龙头公开能力,将行业AI催收能力划分为4个层级——这是衡量我们成长Roadmap的基准尺:

层级能力定义行业状态代表案例
L1 通知提醒型 单向话术播报:告知逾期事实+还款提醒,无交互 2018年已普及 度小满早期机器人
L2 对话式催收 多轮对话:意图识别、施压策略、协商锁定承诺、转人工兜底 行业主流(2023-2025) 金融壹账通加马平台
L3 智能策略型 画像驱动分案、机器人串联升阶、案件全流程自动流转、策略引擎 行业领先者 度言软件安米、壹账通升阶策略
L4 全自动智能催收 大模型自由对话、情绪识别、多模态、实时合规风控、跨渠道(语音+短信+企微) 头部探索中 各头部机构2025-2026方向

6.4 行业基准数据表(评测差距的标尺)

行业公开基准(可查证部分)

指标行业公开水平来源性质用途
作业效率提升80%+(vs 纯人工)✅ 厂商公开案例评估项目价值(我们会议纪要预期70-80%吻合)
ASR/NLU准确率85%✅ 厂商公开案例技术能力基准
逾期客户接通率>45%✅ 厂商公开案例外呼策略基准
对话完成率75%✅ 厂商公开案例对话质量基准
催收语料规模10万+条✅ 厂商公开数据积累目标
流程模板数50+套✅ 厂商公开话术体系目标
质检模型数34套✅ 厂商公开质检体系目标
修复率(催收后还款率)行业公开统一基准极少(各机构内部数据),普遍表述为"AI催收较人工提升数个百分点~十余个百分点"📊 行业报道区间用对照组相对提升衡量,不依赖绝对值
自然修复率(无催收)视客群/账龄差异极大,M1早期约20-35%(行业经验区间)📊 经验区间,需用我方数据确认AB测试基线对照组

标注说明:✅=厂商公开可查证;📊=行业报道/经验区间,需用我方数据实测校准。修复率是各机构核心商业机密,行业无统一公开基准——这也是我们必须自建对照组的根本原因。

6.5 我们的定位与差距分析

差距清单(vs 行业L2-L3水平)

能力维度行业龙头水平我们现状差距性质
催收语料10万+条(壹账通)0(有历史录音未清洗)🔴 需从录音+HR训练数据起步积累
话术/流程模板50+套(壹账通)手工设计FSM+基础话术🔴 需持续沉淀,AB测试驱动扩充
意图识别ASR/NLU 85%(壹账通)规则+模板起步(预计80%以下)🟡 先跑通再迭代模型
质检体系34套自动质检模型规则+人工抽检🟡 先人工后自动化
策略引擎分案+机器人串联升阶+自动流转(L3)单版本+人工分流🟢 正式版预留接口,Q4迭代
客户画像驱动风险评分+还款意愿+历史催收全量接入C卡+还款意愿度(已有,待接入)🟢 有基础数据优势
情绪识别头部L4探索中🟢 后置迭代项

🔴=短期需全力补;🟡=中期迭代;🟢=我们有基础/可后置。

6.6 难度与价值评估

我们在做一个多大难度/价值的事?

难度评估:中高难度(对话式催收是"戴着镣铐跳舞")

价值评估:高价值(战略级降本增效+合规管控)

结论:我们在做的是行业L2主流能力的0-1建设——技术路线成熟(不冒险),但落地执行有较高复杂度(合规+效果平衡)。对标行业,我们的目标不是"创新",而是用最短路径达到行业基准水平,再基于自有客群数据(车贷+车抵贷垂直场景)建立差异化。

6.7 行业基准 → 成长Roadmap(评测差距落地)

Roadmap 各阶段对标行业层级与基准指标

阶段时间目标能力对标行业层级关键基准指标(行业对标)
阶段0 现状 当前 D1-3 单向提醒 L1(2018年行业水平)
阶段1 MVP 8月底 D4-7 对话式催收跑通(结构完整) L2 起步 接通率≥30%→45%(行业>45%);对话完成率≥60%→75%(行业75%);ASR/NLU≥80%→85%
阶段2 正式版 9月中 D1-7 全周期 + 评测体系/AB测试 L2 完善 修复率 vs 对照组(自然/人工)相对提升为正且显著;客诉率≤人工;效率提升向80%靠拢
阶段3 迭代1 Q4 画像驱动策略路由、话术版本AB、Badcase闭环、质检模型起步 L3 部分 意图识别准确率≥85%;质检自动化覆盖率提升;语料积累向10万条靠拢
阶段4 迭代2 2027 Q1 机器人串联升阶、案件自动流转、策略引擎 L3 完善 接通率/完成率稳定达到行业基准;修复率相对提升持续为正
阶段5 探索 2027 全年 大模型自由对话、情绪识别、跨渠道协同 L4 探索 对标头部探索方向,自定评估
评测差距原则:评测体系中每个核心指标都应带行业基准参考值(见5.1指标表新增"行业基准"列)。目标设定遵循"先达标行业基准,再追求超越"——不追求一步到位,但每个迭代都向基准收敛。修复率无行业统一基准,以对照组相对提升为唯一真值。

七、用户未提及但重要的内容

以下是基于催收行业经验、会议纪要上下文和系统设计实践,补充的方案中必须考虑但需求描述中未明确提及的关键内容:

6.1 自然修复率基线(亟需确认)

会议纪要中提到"与徐福珍沟通无催收手段下的自然修复率"——这是整个项目的成败基准线。AI催收的修复率必须显著高于自然修复率才有价值。MVP上线前必须确认D4-D7的自然修复率基线数据。

建议:AB测试的对照组应包含一组"不催收"的基线组,用于同时验证AI催收 vs 人工催收 vs 不催收的效果差异。

6.2 ASR方言/口音适配

催收客户群体多样,方言和口音会严重影响ASR识别率,进而影响意图识别和对话流畅度。MVP阶段需评估:

风险:如果ASR识别率低于80%,对话体验会严重退化,导致修复率远低于预期。MVP阶段建议先用ASR识别置信度做兜底——置信度低时直接走简化话术或转人工。

6.3 呼叫策略优化(接通率)

接通率直接影响修复率的分母。催收场景的接通率通常远低于电销(客户故意不接陌生号码)。需考虑:

6.4 数据安全与隐私保护

6.5 冷启动与数据飞轮

MVP上线时没有线上对话数据,话术库和意图规则都依赖人工经验构建。需要设计数据飞轮机制让系统越用越好:

6.6 区域差异化合规

会议纪要提到"不同地区的催收时间限制、合规要求存在差异"。MVP阶段需要:

MVP简化:先按全国统一规则(8:00-21:00)上线,区域差异化作为正式版的迭代项。

6.7 知识库:产品/合同信息查询

客户可能询问具体的合同条款、利率、费用明细等问题。AI需要能准确回答:

风险:AI给出错误金额/日期信息可能引发客诉或法律风险。金额类信息必须走查询接口填充模板,不能走LLM自由生成。

6.8 还款渠道引导与确认

锁定承诺后的"临门一脚"——引导客户完成还款操作:

6.9 与现有1-3天外呼的衔接

D1-3的外呼策略和D4-7需要在以下方面保持一致或平滑过渡:

八、会议纪要待办事项

从两份会议纪要中提取的全部待办事项,按来源和紧急程度分类:

7.1 8月5日会议纪要待办(算法leader侧)

待办事项负责人关联人状态
向小杰核实"孙伟鹏总找他"是否存在信息混淆 小杰 待办
将催收相关排期表发送给相关需求了解人员 全体参会方 待办
对接徐步真,沟通催收客诉预测需求 徐步真 待办
与徐福珍沟通自然修复率相关事宜(另行敲定时间) 徐福珍 高优
将青龙与吴刚的业务表合并 青龙、吴刚 待办

7.2 8月6日会议纪要待办(业务+技术算法侧)

待办事项负责人关联人状态
对接小杰,沟通催收侧AI能力建设事宜,推进9月上线安排 说话人1 小杰 高优
评估毕总提出的1-7天AI催收测试时间可行性,两日内反馈 说话人1 毕总/业务方 高优(两日内)
整理AI催收全部话术文字版(还款日提醒、逾期1-3天话术),提供给需求方 说话人2 技术团队 待办
询问培训组是否有话术培训类内容,有则发送给需求方 说话人2 培训组 待办
获取话术资料后,结合青龙团队录音分析结论,整理第一版外呼对话思路 说话人1/庆龙 青龙团队 高优
下周一同步初步项目推进思路(不承诺明确交付时间) 说话人1 业务方 下周一
今明两日完成待办事项罗列:明确数据整理周期、输出物、接线等时间节点,同步苏珍 说话人1 苏珍 今明两日
将PMO表及推荐话术相关录音数据发送给需求方 需求方 待办
对接王欢,梳理其团队AI能力及基础情况,评估功能实现可行性 说话人1 王欢 高优
对接HR部门王磊,获取坐席模拟训练系统对话数据 说话人2协助 王磊(HR) 待办
调取优秀催收坐席通话录音(BI系统按标签筛选),数据清洗后用于梳理对话逻辑 庆龙 BI系统 待办
赴上海与毕总当面沟通项目细节,确认最终目标和验收标准 说话人1/吴刚 毕总 待定

九、里程碑与时间线

基于会议纪要的时间节点要求(下周二反馈初步方案、9月测试启动、8月底MVP),规划如下时间线。每个阶段对应的行业能力层级与基准指标6.7 行业基准→成长Roadmap——本时间线是执行层面,6.7是对标层面,两者一一对应。

8月6日(今日)— 8月8日(周五)
📋 阶段0:需求对齐与资料归集
  • 今明两日:罗列待办事项清单,明确数据整理周期/输出物/时间节点,同步苏珍
  • 对接王欢:评估AI能力可行性
  • 获取话术资料(1-3天话术、还款提醒话术、培训资料)
  • 对接庆龙:调取录音分析结论+优质坐席数据集
  • 对接王磊(HR):获取坐席模拟训练系统数据
  • 评估9月测试时间可行性,两日内反馈
8月8日 — 8月12日(下周一)
🏗️ 阶段1:对话框架设计 + 初步方案
  • 基于话术资料+录音分析,输出第一版对话思路(状态机+意图分类+话术大纲)
  • 梳理合规红线要求+区域催收规则,嵌入兜底逻辑
  • 下周一:同步初步项目推进思路给业务方(不承诺交付时间)
8月12日(下周二)
📢 阶段1.5:向业务方反馈初步方案
  • 明确第一期可实现的能力边界、核心排期、资源需求
  • 如有延后风险,提前同步
8月13日 — 8月20日
⚙️ 阶段2:MVP开发(对话引擎+基础话术)
  • 搭建对话管理器(FSM)+ 意图识别(规则版)
  • 构建话术库(每状态×意图至少1-2条,经合规审核)
  • 实现合规过滤器 + 转人工路由
  • 对接现有ASR/TTS+外呼调度
  • 搭建对话日志记录系统
  • 赴上海与毕总当面沟通(确认目标和验收标准)
8月20日 — 8月27日
🧪 阶段3:评测体系搭建 + 离线测试

🎯 对标行业基准(见6.4):接通率≥30%(行业>45%)、对话完成率≥60%(行业75%)、ASR/NLU≥80%(行业85%)——MVP先达标下限,正式版向行业基准收敛

  • 构建测试集(覆盖全意图分支的标准场景)
  • 搭建离线评测引擎(自动跑测+指标计算)
  • 搭建AB测试路由框架
  • 搭建在线监控看板(核心指标)
  • 搭建Badcase审核工作台
  • 8月底前:MVP版本完成,通过离线评测门槛
8月28日 — 9月10日
🚀 阶段4:灰度测试启动
  • 小范围AB测试(5%流量),D4-D7逾期客户
  • 实时监控修复率/承诺率/客诉率/合规指标
  • Badcase收集+人工抽检(5%-10%)
  • 根据数据反馈迭代话术和对话逻辑
9月中旬
✅ 阶段5:正式版上线
  • D1-D7全周期AI催收(D1-3提醒型 + D4-7对话型)
  • 灰度放量至20%→50%→100%
  • 启动D8-D10强压型话术设计(正式版扩展)
⚠️ 时间风险提示:会议纪要中业务方希望9月实现1-7天全量AI催收,技术侧认为"时间偏紧"。上述时间线以MVP先行为原则——8月底跑通D4-7对话核心链路(结构完整但效果待优化),9月灰度测试验证效果。如果8月底MVP未达标,正式版时间需适当后延。建议下周二反馈方案时明确告知业务方时间风险,避免承诺无法兑现。

AI催收外呼项目方案 · D1-D10对话式催收MVP

编制日期:2026年8月6日 · 基于8月5日/6日会议纪要