KDDCUP ASR Top1 ASR 方案复现效果
发布于
谢谢 一直都最喜欢你 我是鸟 永远为你歌唱
实验结论
本次在项目当前 30 段 briefing.mp4 上复测 base、small、medium 和 large-v3。四个模型均使用同一份冻结 Azure Fast Transcription 参考文本、同一份标准 WAV 和同一套归一化与评分规则。
复测成功复现了 Top1 公开结果的主要趋势:
base → small → medium的中文 CER 持续下降;medium的中文识别效果最好;large-v3的正文识别并不差,但末尾重复和无关生成造成大量插入;large-v3的英文 WER 被尾部幻觉显著拉高,复测值与 Top1 公开值高度接近。
模型结果
| 模型 | 中文 CER(本次) | 中文 CER(Top1) | 英文 WER(本次) | 英文 WER(Top1) |
|---|---|---|---|---|
base | 9.7899% | 10.4% | 1.8822% | 1.9% |
small | 6.2560% | 6.8% | 0.8205% | 1.3% |
medium | 3.3110% | 3.2% | 1.0618% | 2.8% |
large-v3 | 6.2878% | 7.2% | 8.4942% | 8.7% |
top1数据来源其小红书发表的帖子:

运行时间
64 核 CPU 比赛环境下的 30 视频估算
30 个视频的总音频时长为 2686.72 秒(44.78 分钟)。比赛环境没有 GPU,每个 ASR 任务使用 8 个 CPU 线程,最多同时运行 8 个任务。根据当前机器已有实测 RTF,对不同任务到达和并发水平进行估算:
| 模型 | 始终只有 1 条待处理 | 平均 2 个并发 | 平均 4 个并发 | 30 条同时到达、最多 8 并发 |
|---|---|---|---|---|
base | 2 分 54 秒 | 1 分 27 秒 | 43 秒 | 约 25 秒 |
small | 7 分 22 秒 | 3 分 41 秒 | 1 分 50 秒 | 约 1 分 04 秒 |
medium | 20 分 42 秒 | 10 分 21 秒 | 5 分 11 秒 | 约 2 分 59 秒 |
large-v3 | 39 分 19 秒 | 19 分 40 秒 | 9 分 50 秒 | 约 5 分 40 秒 |
其中,最后一列使用 30 条视频的真实时长分布进行 FIFO 调度,不是简单地把顺序运行时间除以 8。
估算依据如下:
base、small来自本机完整 30 条 CPU/int8 运行;medium来自task_6的 CPU/int8、4 线程测试;large-v3来自task_6的 CPU/int8、4 线程测试。- 表中未计入模型冷启动、8 个模型副本的内存压力、并发时的缓存/内存带宽争用和视频到达不均匀造成的排队。
在比赛环境的64核CPU下,并发处理视频的ASR,虽然large-v3运行时间为base的运行时间的10倍以上,但是完整处理时间任然可以压在10分分钟以下,处理速度确实可以接受。
编辑距离明细
| 模型 | 中文 S | 中文 D | 中文 I | 英文 S | 英文 D | 英文 I |
|---|---|---|---|---|---|---|
base | 566 | 13 | 36 | 26 | 4 | 9 |
small | 314 | 17 | 62 | 11 | 2 | 4 |
medium | 163 | 17 | 28 | 8 | 1 | 13 |
large-v3 | 93 | 14 | 288 | 26 | 6 | 144 |
S:替换,指预测文本中的词/字被错误地识别成了其他词/字。D:删除,指参考文本中的词/字在预测文本里缺失了。I:插入(Insertion),指预测文本中额外多出了参考文本里不存在的词/字。
large-v3 的替换数较少,但插入数远高于其他模型。这说明其高 CER/WER 主要不是正文听写能力差,而是音频正文结束后继续生成内容,与 Top1 报告的末尾幻觉机制一致。
large-v3 幻觉证据
典型样本:
task_54:中文插入 152 个字符;正文结束后继续生成多段与任务无关的中文和中英混合内容。task_22:英文插入 83 个词;正文结束后继续生成关于文件夹、站点和保存操作的无关内容。task_39:中文插入 64 个字符;结尾“提交、投委会收到”被连续重复多次。task_41:英文插入 35 个词;“The report is now ready to be exported.” 被重复四次。
本次至少观察到 4 条中文和 2 条英文样本存在超过 20 个单元的严重插入;另有若干较轻的重复或追加。该现象与 Top1 所述“中文 5 条、英文 2 条”的错误分布接近,但本项目尚未定义独立的幻觉判定阈值,因此不把该计数作为正式指标。
运行范围
- Gold ID:
azure-all-20260725 - 样本数:30
- 中文样本:20
- 英文样本:10
- 四模型转写成功率:均为
30/30(100%) - 四模型语言检测准确率:均为
30/30(100%) - 评分口径:相对冻结 Azure Fast Transcription 输出,不是相对人工标注
对应 Run ID:
base-cpu-int8-all-20260725small-cpu-int8-all-20260725medium-cuda-float16-all-20260725large-v3-cuda-float16-all-20260725
结论与后续基线
本次复测支持 Top1 的模型选择结论:medium 是当前四个模型中最适合作为后续 Prompt 优化起点的模型。
- 相比
base,medium 中文 CER 从 9.7899% 降至 3.3110%。 - 相比
small,medium 中文 CER 从 6.2560% 降至 3.3110%。 large-v3虽然正文替换更少,但其严重插入会污染下游 Agent,不适合作为未经治理的自动化生产基线。- 下一阶段应固定
medium-cuda-float16-all-20260725作为无 Prompt 对照,测试 Qwen 动态术语 Prompt 和中文通用 UI 术语。
Medium Top1 优化消融(2026-07-26)
实验在本机NVIDIA GeForce RTX 4060 Laptop GPU(8 GB 显存)上执行,统一配置为medium / CUDA / float16 / num_workers=1。
四阶段使用相同的 azure-all-20260725、30 份标准 WAV 和 20 条中文、10 条英文样本。所有指标都是相对冻结 Azure Fast Transcription 输出的 corpus-level CER/WER,不代表相对人工标注的绝对准确率。
最新评分口径
- 双方统一执行 Unicode NFKC、英文小写和繁体转简体。
- 中文数字统一转换为阿拉伯数字,例如
十 → 10、第十一名 → 第11名、60万0230 → 600230,然后去除标点并按字符计算 CER。 - 英文去除标点后按词计算 WER;
pop up ↔ popup、cut off ↔ cutoff等仅有 词边界拆分或合并差异的形式按正确处理。 - Qwen 只读取对应任务的
task.json问题与knowledge.md,不读取 Azure gold 或逐条错误答案。
四阶段结果
| 阶段 | 中文 CER | 英文 WER | 成功率 | tiny 成功 | Prompt 成功 | 总耗时 |
|---|---|---|---|---|---|---|
medium-baseline | 4.7281% | 0.8687% | 30/30 | 不适用 | 不适用 | 159.50 秒 |
tiny-route | 3.0890% | 0.8687% | 30/30 | 30/30 | 不适用 | 156.98 秒 |
dynamic-prompt | 2.5690% | 0.4826% | 30/30 | 30/30 | 30/30 | 207.30 秒 |
dynamic-plus-ui | 1.9858% | 0.6757% | 30/30 | 30/30 | 30/30 | 203.55 秒 |
top1帖子公布的最佳运行结果:

成绩基本相近,基本已经达到与top1 asr方案一致的效果。
分阶段耗时:
| 阶段 | tiny 检测 | Qwen Prompt | medium 转写 |
|---|---|---|---|
medium-baseline | 0.00 秒 | 0.00 秒 | 159.50 秒 |
tiny-route | 2.57 秒 | 0.00 秒 | 151.72 秒 |
dynamic-prompt | 2.55 秒 | 35.46 秒 | 166.43 秒 |
dynamic-plus-ui | 2.47 秒 | 32.99 秒 | 165.32 秒 |
编辑距离明细:
| 阶段 | 中文 S | 中文 D | 中文 I | 英文 S | 英文 D | 英文 I |
|---|---|---|---|---|---|---|
medium-baseline | 151 | 9 | 140 | 6 | 0 | 12 |
tiny-route | 151 | 9 | 36 | 6 | 0 | 12 |
dynamic-prompt | 137 | 5 | 21 | 4 | 0 | 6 |
dynamic-plus-ui | 100 | 5 | 21 | 6 | 0 | 8 |