实习产出 / 可复用工作流
00 / PROJECT OVERVIEW
把经验封装成团队可以复用的能力
把实习中反复出现的 Prompt 配置、Badcase 修复和 ASR 评测方法,整理成有输入、步骤、产物和门禁的可复用工作流。
- Prompt 生成
- Badcase 修补
- ASR 与标签评测
- 01
- 4 已整理 Skills
- 02
- 全链路 输入—处理—产物
- 03
- HITL 保留人工决策
01 S01
SOP + 录音 → 语音 Agent 系统提示词
把新客户的业务材料与历史通话,转成运营能直接接手的 Prompt 和配置指南。
INPUT任意数量 SOP 文件 + 100—500 通人工通话 ASR 文本
PROCESS归一化与脱敏 → 场景分类 → 资产提炼 → Prompt 生成 → 冒烟与两轮迭代 → 验收门禁
OUTPUTSystem Prompt v0.1、10 章运营指南,以及异议库、评估集、ASR 纠错词典等结构化中间产物
人工边界自动化形成初稿与验证材料,A/B 结果和上线版本仍由运营判断。
02 S02
Badcase → Prompt 最小修补与双向回归
从真实坏案例出发定位根因,只改需要改的部分,并检查修复是否伤害原有好表现。
INPUT真实 badcase、运营期望方向、当前 Prompt、已知良好语料
PROCESS旧版冷读复现 → 根因归类 → 段级最小补丁 → fix-set 验证 → regression-set 验证
OUTPUT段级 Diff、诊断报告、自测结果、变更摘要与不属于 Prompt 的转交项
人工边界未复现、未修好、回归倒退或评测集为空时,机械门禁直接阻止交付。
03 S03
ASR 中间结果 → 语义影响分析
判断识别文本变化是否真的会改变 Agent 的回复与动作,而不只比较字面差异。
INPUTASR mid / fin 成对文本与对应会话信息
PROCESS配对 → 差异分桶 → 槽位与意图规则 → 两轮语义判断 → 高置信覆盖与质量分开统计
OUTPUT可追踪的中间表、语义判定结果、问题分布与两类统计口径
人工边界保留“无法判断”状态,不把缺少上下文的样本强行归为一致或不一致。
04 S04
错判案例 → 对话标签规则优化
用具体错判案例修正规则,再按固定判断模板逐条回放,直到输入案例能够被正确识别。
INPUT对话内容、系统错判标签、期望标签、完整标签配置与话术
PROCESS复现 → 诊断冲突 → 修订任务描述与标签语义 → 固定模板冷读回放 → 继续修订
OUTPUT可复制进运营平台的规则、诊断报告、自测结果与变更摘要
人工边界固定判断模板不随优化改写,防止通过修改评测方式得到虚假的通过结果。