SPEECH RECOGNITION / EVALUATION
模型对比
同一段声音,四种识别路径。
比较实时文本、说话人归属、首字延迟与整段转写速度。所有模型使用同一份 16 kHz 单声道音频。
01音频 & 参考标注
≤ 200 MB / 60 min粘贴参考文本(仅单音频)
02模型 & 测试协议
DER 评分协议
四模型依次调用,每次重复轮换顺序。实时模型包含音频发送耗时,非流式没有真正的流式首字时间。不同区域及协议在 Benchmark 中分组。
比较实时文本、说话人归属、首字延迟与整段转写速度。所有模型使用同一份 16 kHz 单声道音频。
只展示本工作区真实运行结果。延迟按运行汇总;准确率按参考长度加权,不填充公开排行榜或模拟数据。
官方来源与许可已核对。目录不等于已下载的数据;只在取得使用授权后上传音频及对应参考。
tools/prepare_dataset.py 将音频 + JSON / RTTM / TextGrid 或 AMI XML 转成测试片段与统一 JSON 标注。音频仅保存在当前 VM 的受保护目录;比较任务执行时才发送到相应 Azure 服务。
查看成功、失败与空文本结果。导出的 JSON 包含原始服务响应和事件时间线,不含 Azure 凭据。
避免把上传时间、整段返回时间或辅助分离结果混成一个不可解释的指标。