KDDCUP ASR Top1 ASR 方案复现效果

3468 字
9 分钟

KDDCUP ASR Top1 ASR 方案复现效果

发布于

谢谢 一直都最喜欢你 我是鸟 永远为你歌唱

实验结论

本次在项目当前 30 段 briefing.mp4 上复测 basesmallmediumlarge-v3。四个模型均使用同一份冻结 Azure Fast Transcription 参考文本、同一份标准 WAV 和同一套归一化与评分规则。

复测成功复现了 Top1 公开结果的主要趋势:

  • base → small → medium 的中文 CER 持续下降;
  • medium 的中文识别效果最好;
  • large-v3 的正文识别并不差,但末尾重复和无关生成造成大量插入;
  • large-v3 的英文 WER 被尾部幻觉显著拉高,复测值与 Top1 公开值高度接近。

模型结果

模型中文 CER(本次)中文 CER(Top1)英文 WER(本次)英文 WER(Top1)
base9.7899%10.4%1.8822%1.9%
small6.2560%6.8%0.8205%1.3%
medium3.3110%3.2%1.0618%2.8%
large-v36.2878%7.2%8.4942%8.7%

top1数据来源其小红书发表的帖子:

1785054758575
1785054758575

运行时间

64 核 CPU 比赛环境下的 30 视频估算

30 个视频的总音频时长为 2686.72 秒(44.78 分钟)。比赛环境没有 GPU,每个 ASR 任务使用 8 个 CPU 线程,最多同时运行 8 个任务。根据当前机器已有实测 RTF,对不同任务到达和并发水平进行估算:

模型始终只有 1 条待处理平均 2 个并发平均 4 个并发30 条同时到达、最多 8 并发
base2 分 54 秒1 分 27 秒43 秒约 25 秒
small7 分 22 秒3 分 41 秒1 分 50 秒约 1 分 04 秒
medium20 分 42 秒10 分 21 秒5 分 11 秒约 2 分 59 秒
large-v339 分 19 秒19 分 40 秒9 分 50 秒约 5 分 40 秒

其中,最后一列使用 30 条视频的真实时长分布进行 FIFO 调度,不是简单地把顺序运行时间除以 8。

估算依据如下:

  • basesmall 来自本机完整 30 条 CPU/int8 运行;
  • medium 来自 task_6 的 CPU/int8、4 线程测试;
  • large-v3 来自 task_6 的 CPU/int8、4 线程测试。
  • 表中未计入模型冷启动、8 个模型副本的内存压力、并发时的缓存/内存带宽争用和视频到达不均匀造成的排队。

在比赛环境的64核CPU下,并发处理视频的ASR,虽然large-v3运行时间为base的运行时间的10倍以上,但是完整处理时间任然可以压在10分分钟以下,处理速度确实可以接受。

编辑距离明细

模型中文 S中文 D中文 I英文 S英文 D英文 I
base56613362649
small31417621124
medium16317288113
large-v39314288266144
  • S:替换,指预测文本中的词/字被错误地识别成了其他词/字。
  • D:删除,指参考文本中的词/字在预测文本里缺失了。
  • I:插入(Insertion),指预测文本中额外多出了参考文本里不存在的词/字。

large-v3 的替换数较少,但插入数远高于其他模型。这说明其高 CER/WER 主要不是正文听写能力差,而是音频正文结束后继续生成内容,与 Top1 报告的末尾幻觉机制一致。

large-v3 幻觉证据

典型样本:

  • task_54:中文插入 152 个字符;正文结束后继续生成多段与任务无关的中文和中英混合内容。
  • task_22:英文插入 83 个词;正文结束后继续生成关于文件夹、站点和保存操作的无关内容。
  • task_39:中文插入 64 个字符;结尾“提交、投委会收到”被连续重复多次。
  • task_41:英文插入 35 个词;“The report is now ready to be exported.” 被重复四次。

本次至少观察到 4 条中文和 2 条英文样本存在超过 20 个单元的严重插入;另有若干较轻的重复或追加。该现象与 Top1 所述“中文 5 条、英文 2 条”的错误分布接近,但本项目尚未定义独立的幻觉判定阈值,因此不把该计数作为正式指标。

运行范围

  • Gold ID:azure-all-20260725
  • 样本数:30
  • 中文样本:20
  • 英文样本:10
  • 四模型转写成功率:均为 30/30(100%)
  • 四模型语言检测准确率:均为 30/30(100%)
  • 评分口径:相对冻结 Azure Fast Transcription 输出,不是相对人工标注

对应 Run ID:

  • base-cpu-int8-all-20260725
  • small-cpu-int8-all-20260725
  • medium-cuda-float16-all-20260725
  • large-v3-cuda-float16-all-20260725

结论与后续基线

本次复测支持 Top1 的模型选择结论:medium 是当前四个模型中最适合作为后续 Prompt 优化起点的模型。

  • 相比 base,medium 中文 CER 从 9.7899% 降至 3.3110%。
  • 相比 small,medium 中文 CER 从 6.2560% 降至 3.3110%。
  • large-v3 虽然正文替换更少,但其严重插入会污染下游 Agent,不适合作为未经治理的自动化生产基线。
  • 下一阶段应固定 medium-cuda-float16-all-20260725 作为无 Prompt 对照,测试 Qwen 动态术语 Prompt 和中文通用 UI 术语。

Medium Top1 优化消融(2026-07-26)

实验在本机NVIDIA GeForce RTX 4060 Laptop GPU(8 GB 显存)上执行,统一配置为medium / CUDA / float16 / num_workers=1

四阶段使用相同的 azure-all-20260725、30 份标准 WAV 和 20 条中文、10 条英文样本。所有指标都是相对冻结 Azure Fast Transcription 输出的 corpus-level CER/WER,不代表相对人工标注的绝对准确率。

最新评分口径

  • 双方统一执行 Unicode NFKC、英文小写和繁体转简体。
  • 中文数字统一转换为阿拉伯数字,例如 十 → 10第十一名 → 第11名60万0230 → 600230,然后去除标点并按字符计算 CER。
  • 英文去除标点后按词计算 WER;pop up ↔ popupcut off ↔ cutoff 等仅有 词边界拆分或合并差异的形式按正确处理。
  • Qwen 只读取对应任务的 task.json 问题与 knowledge.md,不读取 Azure gold 或逐条错误答案。

四阶段结果

阶段中文 CER英文 WER成功率tiny 成功Prompt 成功总耗时
medium-baseline4.7281%0.8687%30/30不适用不适用159.50 秒
tiny-route3.0890%0.8687%30/3030/30不适用156.98 秒
dynamic-prompt2.5690%0.4826%30/3030/3030/30207.30 秒
dynamic-plus-ui1.9858%0.6757%30/3030/3030/30203.55 秒

top1帖子公布的最佳运行结果:

1785055129592
1785055129592

成绩基本相近,基本已经达到与top1 asr方案一致的效果。

分阶段耗时:

阶段tiny 检测Qwen Promptmedium 转写
medium-baseline0.00 秒0.00 秒159.50 秒
tiny-route2.57 秒0.00 秒151.72 秒
dynamic-prompt2.55 秒35.46 秒166.43 秒
dynamic-plus-ui2.47 秒32.99 秒165.32 秒

编辑距离明细:

阶段中文 S中文 D中文 I英文 S英文 D英文 I
medium-baseline15191406012
tiny-route1519366012
dynamic-prompt137521406
dynamic-plus-ui100521608