From c721471f3778334f0cdcfdd3a098e1353652762a Mon Sep 17 00:00:00 2001
From: Ariver <shanghai3168@gmail.com>
Date: Sun, 07 Jun 2026 01:17:41 +0800
Subject: [PATCH] Document X-ASR experiment branch

---
 02-P-NBL/plan.md |   89 ++++++++++++++++++++++++++++++++++++++------
 1 files changed, 76 insertions(+), 13 deletions(-)

diff --git a/02-P-NBL/plan.md b/02-P-NBL/plan.md
index c68c33b..5c15f1e 100644
--- a/02-P-NBL/plan.md
+++ b/02-P-NBL/plan.md
@@ -28,6 +28,7 @@
 Round 4:接英文高级 Parakeet
 Round 5:接中文高级 Qwen3-ASR
 Round 6:完善模型管理和未来欧洲语言扩展
+Round 7:X-ASR 流式中英混输候选模型评估
 ```
 
 第一期可交付版本建议至少做到:
@@ -48,6 +49,7 @@
 | Round 4 | Parakeet 高级模型 | 英文用户可下载 Parakeet | 中 |
 | Round 5 | Qwen3-ASR 高级模型 | 中文用户可下载 Qwen3-ASR | 高 |
 | Round 6 | 模型管理成熟化 + 欧洲语言准备 | 删除、回滚、未来多语言 | 中 |
+| Round 7 | X-ASR 流式候选模型评估 | 未来可能支持实时边说边出字和中英混输 | 中高 |
 
 ## 3. Round 1:模型 Profile 基础设施
 
@@ -431,9 +433,56 @@
 中等。
 建议 4-8 个研发日。
 
-## 9. 推荐发布组合
+## 9. Round 7:X-ASR 流式中英混输候选模型评估
 
-### 9.1 内部技术版本
+### 9.1 目标
+
+评估 `Gilgamesh-J/X-ASR` 的 `X-ASR-zh-en` 是否值得纳入未来模型选项,重点不是“再加一个模型”,而是判断它能否带来当前模型没有覆盖好的实时输入价值。
+
+### 9.2 产品假设
+
+X-ASR 的价值主要来自:
+
+- 中文/英文双语和中英混输。
+- true streaming decoding,可支撑未来“边说边出字”。
+- 基于 sherpa-onnx,和当前模型技术栈方向一致。
+- 相比 Qwen3-ASR,可能牺牲一部分离线准确率,换取更小模型规模和更强低延迟交互能力。
+
+### 9.3 范围
+
+评估项:
+
+- 下载并整理 `X-ASR-zh-en` 单个 chunk 变体。
+- 初始只选一个 chunk,不带四个 chunk 全量包。
+- 优先测试 `480 ms` 或 `960 ms`:前者偏低延迟,后者偏准确率。
+- 新增实验性 `x-asr-zh-en` profile,但默认隐藏在普通用户 UI 之外。
+- 验证 sherpa-onnx Go 绑定是否支持当前所需 streaming API。
+- 如当前离线 Engine 接口不适合,先做独立 streaming prototype,不直接接入正式录音上屏链路。
+
+### 9.4 不做
+
+- 不替换 SenseVoice 中文默认模型。
+- 不替换 Qwen3-ASR 中文高级模型。
+- 不替换 Moonshine/Parakeet English 路线。
+- 不把四个 chunk 一起发布。
+- 不在技术报告和合规材料补齐前作为正式推荐模型。
+
+### 9.5 验收标准
+
+- 明确 X-ASR 与 SenseVoice、Qwen3-ASR、Moonshine、Parakeet 的定位差异。
+- 至少完成 Apple Silicon 真机延迟、内存、发热、识别质量 smoke test。
+- 覆盖中文、中英混输、英文技术词、长句口述和噪声样本。
+- 输出是否进入产品路线的决策:`放弃 / 保留研究 / 实验入口 / 正式候选`。
+- 如果进入产品路线,补齐模型 profile、下载、校验、删除、失败回退和 license notice 方案。
+
+### 9.6 预估工作量
+
+中高。
+建议 3-5 个研发日做技术 spike;如果进入正式产品化,再单独拆 Round。
+
+## 10. 推荐发布组合
+
+### 10.1 内部技术版本
 
 ```text
 Round 1
@@ -443,7 +492,7 @@
 
 - 验证 profile 抽象不会破坏现有 SenseVoice。
 
-### 9.2 English MVP
+### 10.2 English MVP
 
 ```text
 Round 1 + Round 2 + Round 3
@@ -455,7 +504,7 @@
 - 默认 Moonshine English。
 - 形成英文用户可用版本。
 
-### 9.3 English Pro
+### 10.3 English Pro
 
 ```text
 Round 4
@@ -465,7 +514,7 @@
 
 - 为英文用户提供 Parakeet 高级模型。
 
-### 9.4 Chinese Pro
+### 10.4 Chinese Pro
 
 ```text
 Round 5
@@ -475,7 +524,7 @@
 
 - 为中文用户提供 Qwen3-ASR 高级模型。
 
-### 9.5 多语言准备版
+### 10.5 多语言准备版
 
 ```text
 Round 6
@@ -486,9 +535,20 @@
 - 稳定模型管理。
 - 为未来欧洲语言版本做技术准备。
 
-## 10. 关键依赖
+### 10.6 实时输入探索版
 
-### 10.1 模型包确认
+```text
+Round 7
+```
+
+目的:
+
+- 验证 X-ASR 是否能支撑实时中英混输输入体验。
+- 在不影响当前正式模型路线的前提下,为未来“边说边出字”做技术判断。
+
+## 11. 关键依赖
+
+### 11.1 模型包确认
 
 每个模型需要确认:
 
@@ -500,16 +560,16 @@
 - macOS 可运行性。
 - sherpa-onnx 当前 Go 绑定支持情况。
 
-### 10.2 sherpa-onnx 版本
+### 11.2 sherpa-onnx 版本
 
 当前项目使用 `v1.12.24`。
 Qwen3-ASR 在较新版本中支持更完整。建议在 Round 1 或 Round 5 前评估是否升级到较新 `sherpa-onnx-go`。
 
-### 10.3 UI 文案
+### 11.3 UI 文案
 
 English 分支需要完整英文 UI 文案,不只是模型页面。
 
-### 10.4 回归测试音频
+### 11.4 回归测试音频
 
 需要准备:
 
@@ -518,8 +578,9 @@
 - 英文短句。
 - 英文技术词。
 - Parakeet 支持语言样例,后续使用。
+- X-ASR 中英混输和实时 partial 输出样例,后续使用。
 
-### 10.5 后续 UI 与品牌命名调整
+### 11.5 后续 UI 与品牌命名调整
 
 以下需求已进入 `v2.1.24 build 20260603.1934` 品牌命名调整:
 
@@ -527,7 +588,7 @@
 - App 正式名称从 `PrivateVoice Input` 改为 `PrivateVoice Dictation`。
 - 本轮不迁移用户数据目录,继续使用既有 `Application Support/PrivateVoice Input`,避免影响历史记录、模型文件和系统权限。
 
-## 11. 总体建议
+## 12. 总体建议
 
 最稳的执行策略:
 
@@ -538,8 +599,10 @@
 发布 English MVP
 再做 Round 4 和 Round 5
 最后做 Round 6
+单独做 Round 7 X-ASR 技术 spike
 ```
 
 不要在 Round 1 里同时接 Moonshine、Parakeet、Qwen3-ASR。
 不要在 English MVP 之前先做 30 种语言 UI。
 不要把 Parakeet 和 Qwen3-ASR 作为默认模型自动下载。
+不要把 X-ASR 混入当前正式模型发布链路;先证明实时输入价值。

--
Gitblit v1.9.3