Ariver
2026-06-07 c721471f3778334f0cdcfdd3a098e1353652762a
02-P-NBL/product-plan.md
@@ -296,6 +296,48 @@
- 用户主动下载后可切换。
- Moonshine English 保留作为 fallback。
### 8.5 X-ASR-zh-en(未来候选)
产品定位:
- 未来候选的中文/英文低延迟流式模型。
- 适合“边说边出字”、中英自由混输、长句口述、代码/写作实时输入等交互方向。
- 不替代当前第一阶段四模型,不作为默认模型;先作为研究和原型验证项。
相对现有模型的潜在用户价值:
- 相对 SenseVoice:更明确面向中文/英文流式识别和低延迟部署,可能提升中英混输、长句、实时反馈体验。
- 相对 Qwen3-ASR:质量指标整体低于 Qwen3-ASR 0.6B/1.7B,但模型规模更小、流式能力更强,可能成为“实时输入模式”的更合适选择。
- 相对 Moonshine/Parakeet:覆盖中文和英文双语,能减少用户在中文/英文之间手动切换模型的频率。
已知资料摘要:
- 项目:`Gilgamesh-J/X-ASR`
- 模型:`X-ASR-zh-en`
- 架构:Zipformer transducer
- 运行时:sherpa-onnx
- 语言:Chinese + English
- 模式:offline decoding + true streaming decoding
- chunk 选项:160 ms、480 ms、960 ms、1920 ms
- License:Apache-2.0
- 技术报告:Coming Soon
产品策略:
- 不随 App 默认打包。
- 不一次性带四个 chunk 变体;先选一个候选 chunk 做真机评估。
- 初始评估优先 `480 ms` 或 `960 ms`:`480 ms` 偏实时反馈,`960 ms` 偏准确率和稳定性。是否采用 `160 ms` 或 `1920 ms` 由真机延迟/准确率测试决定。
- 如果只服务当前“说完再上屏”模式,X-ASR 优先级低于 Qwen3-ASR;如果要做“实时边说边出字”,X-ASR 优先级升高。
进入产品前必须验证:
- Go 端是否能用现有 sherpa-onnx 绑定稳定加载 Zipformer transducer streaming 模型。
- 是否需要新增 `OnlineRecognizer`/streaming engine,而不是复用当前离线 `Engine` 接口。
- Apple Silicon 上 CPU 延迟、内存占用、发热和长时间运行稳定性。
- 中英混输、中文标点、英文大小写、技术词和噪声场景的真机样本效果。
- 模型文件体积、下载速度、断点续传和磁盘占用。
- Apache-2.0 license、模型卡、训练数据说明和后续技术报告发布后的合规复核。
## 9. 推荐用户流程
### 9.1 中文用户首次使用
@@ -397,3 +439,5 @@
- sherpa-onnx Qwen3-ASR: https://k2-fsa.github.io/sherpa/onnx/qwen3-asr/index.html
- sherpa-onnx Qwen3-ASR pretrained model: https://k2-fsa.github.io/sherpa/onnx/qwen3-asr/pretrained.html
- SenseVoice 2025-09-09 model files: https://huggingface.co/csukuangfj/sherpa-onnx-sense-voice-zh-en-ja-ko-yue-int8-2025-09-09/tree/main
- X-ASR GitHub project: https://github.com/Gilgamesh-J/X-ASR
- X-ASR-zh-en model artifacts: https://huggingface.co/GilgameshWind/X-ASR-zh-en