Chinese-Jev:把 System-One 决策模型带到中文任务
- 关联论文:2609.36965
- 作者:flyP
- 更新:2026-10-01
一、一句话结论
Jev 这类 System-One 决策模型过去主要跑英文,Chinese-Jev 用一套「中文标注 → 候选概率目标」的统一数据管线 + encoder-only 轻量骨干,把中文决策任务的准确率拉到了比闭源 Jev 还高 1.24%、速度 20.3× 的水平,并在医疗、法律、金融三个垂直领域做到 15 ms/例的低延迟,INT8 量化后能在手机上做到 1 秒/决策。
二、解决的真问题
LLM(大语言模型)是 System-Two:自由生成、慢、贵、答案不稳定。但在大量决策类任务里——"这份合同是否合规"、"这条医疗记录属于哪个 ICD 编码"、"这条投诉应分到哪个处理队列"——我们其实不需要一段开放文本,只需要在有限候选里选一个。这类问题更适合 System-One:一个轻量的、确定性的、可量化校准的模型。
System-One 这条路线最近由 Jev(论文里以闭源参照出现)推动,主打"用概率目标替代自由生成"。但它的中文准确率明显落后,原因有三:
- 训练数据是英文主导,中文只是少量 fine-tune;
- 中文标注形态异质(实体标签、关系标签、分类标签、序列标注、抽取式 QA 答案),无法用统一目标训练;
- 中文垂直领域(医疗、法律、金融)术语密度高、口径严,预训练分布严重错位。
Chinese-Jev 针对这三点给出了一套统一数据协议 + 轻量骨干 + 领域分阶段微调的完整方案。
三、核心方法
3.1 数据协议:把一切中文任务变成「候选概率目标」
异质中文标注 → 统一 schema:
原始标注(任意形态)
│
▼
候选生成器(Candidate Generator)
│ 对每条样本生成 K 个候选选项 + 1 个 gold
▼
概率目标向量 y ∈ R^K
│ y_gold = 1.0,其余按"语义距离"或"难度"赋 soft label
▼
训练样本 (x_text, y)
任何形态(实体、关系、分类、抽取式 QA、阅读理解选项题)都被压成 (文本, 候选概率分布)。这样骨干、损失、推理三件事可以完全复用——这是整篇论文的"地基"。
3.2 模型:encoder-only 轻量骨干
- 文本编码:去掉 decoder 部分的 Transformer encoder,去掉自回归生成头;
- 决策头:在
[CLS](或对应聚合 token)上接 K 维 softmax,输出候选概率而非文本; - 损失:KL 散度 / cross-entropy on probability targets;
- 推理:
argmax或校准后的阈值判定,完全不需要 beam search、也不需要采样。
带来的好处:
- 显存占用小(encoder-only 比 decoder-only 少一个数量级);
- 延迟确定(一次前向 + 一次 softmax);
- 可校准(输出本身是概率,可以直接对接下游阈值/规则);
- 可量化(INT8 几乎无损,论文给出实测)。
3.3 训练策略:通用预训练 + 领域微调两阶段
阶段 1:通用中文预训练
- 数据:10M 条通用语料(含新闻、百科、社区问答等)
- 目标:让 encoder 学会"中文 → 候选概率"这件事的通用形态
↓
阶段 2:领域微调 ×3(医疗 / 法律 / 金融)
- 数据:各领域标注(带 gold 与候选)
- 目标:在不破坏通用形态的前提下,把术语与口径对齐到领域
论文强调这种"先通用后垂直"的拆解是为了避免灾难性遗忘——直接把医疗数据灌进 encoder 会让模型把通用决策能力丢掉。
3.4 评估:CJ-Bench
作者自建了 Chinese-Jev Bench(简称 CJ-Bench),覆盖:
- 通用决策任务(事实核查、属性分类、常识推理选项题);
- 医疗(ICD 编码、症状归类、合理性判断);
- 法律(罪名分类、条款匹配);
- 金融(风险标签、合规判定)。
每个样本都遵循"候选 + gold + 概率目标"格式,保证跨领域、跨题型可比。
四、关键实验与数据
| 指标 | Chinese-Jev | 闭源 Jev(参照) | 备注 |
|---|---|---|---|
| 通用任务准确率 | +1.24% | 基线 | 同口径对比 |
| 推理速度 | 20.3× | 1× | encoder-only vs decoder-based |
| 医疗领域准确率 | +4.0% | 基线 | 微调后 |
| 法律 + 金融平均 | 92% of Jev | 100% | 中文垂直场景差距收敛 |
| 平均延迟 | 15 ms / 例 | — | CPU/GPU 配置原文未明确 |
| INT8 量化(手机) | ~1.0 s / decision | — | on-device |
几点值得注意:
- 速度优势来自结构选择,不是工程优化。把生成换成 K 维分类,前向计算量本身下降一档。
- 垂直微调收益主要来自"口径对齐"——并不是模型"学到了新知识",而是把候选语义对齐到领域标准。
- 校准是副产品——输出是概率,所以 CJ-Bench 里能直接报 ECE(Expected Calibration Error),这是 LLM 难以做到的。
五、亮点
- 统一数据协议是真贡献。把中文异质标注变成
候选概率目标,直接解锁了"一个模型跑所有决策任务"的可能性。 - System-One 的价值被实证。20.3× 速度、15 ms 延迟、INT8 上手机——这些数字组合在一起,让"在端侧做决策"不再是空话。
- 领域拆分克制。只做了医疗 / 法律 / 金融,没贪多,反而显得工程上落地。
- 可校准性——概率输出本身就是好处,对下游阈值、规则、人工复核友好。
六、局限与诚实标注
- 没有公开领域微调数据规模。论文只说"fine-tune it separately for the medical, legal, and financial domains",数据量、来源、合规性原文未明确。这在医疗 / 法律 / 金融是硬约束。
- CJ-Bench 自建,未与外部权威基准对齐。论文没有报告 CJ-Bench 与 C-Eval、CMMLU、SuperCLUE 等中文榜单的对比,口径可比性存疑。
- decoder-based LLM 基线缺失。论文只比了闭源 Jev,没有比"用 Qwen2.5 / GLM-4 / DeepSeek 做同样决策题"的 zero-shot 或 constrained-decoding 结果。这让"+1.24%"的含金量难以独立验证。
- 量化误差未量化。说"INT8 on-device 约 1 秒/decision",但精度损失、ECE 变化、长文本截断策略均未明确给出。
- 公平性 / 偏差问题原文未涉及。医疗、法律、金融是高风险领域,决策模型必须有 subgroup 偏差评估,本文未触及。
- 关于闭源 Jev 的真实能力,原文只给相对增量,Jev 自身的 baseline 数值在论文里是否经过同口径复现,原文未明确。
七、对工程落地的启发
- 如果你的任务能写成"候选集合里的选择",先把 System-One 路线作为一选项。延迟、成本、可校准性是 LLM 给不了的。
- 统一"概率目标"协议是真正的杠杆。很多团队今天还在为每个任务训练一个分类器,Chinese-Jev 提示了"一套数据协议 + 一个骨干"的可行性。
- 领域微调前先通用预训练——不是为了"打基础"这种空话,而是为了保留跨任务泛化与抗遗忘能力。
- 校准是 underrated 的资产。做风控、做合规、做医疗分诊,输出概率比输出文本更有用。
- 手机 / 端侧决策场景应当被重新评估。15 ms 服务端、1 s 端侧意味着很多"必须上云"的判断可以本地完成。
八、工程落地的具体坑(≥5 条)
| # | 坑 | 现象 | 影响 | 修复 |
|---|---|---|---|---|
| 1 | 把"分类任务"硬塞给生成式 LLM | 用 ChatGLM 做 100 选 1 的罪名分类,结果在 top-1 上才 60% 出头,且每次回答措辞不同 | 准确率上不去、不可校准、延迟高 | 先判定任务是不是"有限候选 + 决策",是的话直接走 encoder + softmax 路线 |
| 2 | 候选生成器质量差 | 统一协议把"产出候选"这一步外包给上游 pipeline,但很多团队用关键词匹配 / 规则模板 | gold 候选根本没进 K 集合,模型怎么训都到不了上限 | 候选生成必须与 gold 标注同口径评测(覆盖率 ≥99%),并对长尾类别做强制召回 |
| 3 | soft label 设计不当 | 把"非 gold 候选"全设成 0,等价于 one-hot,丢失"难度梯度"信息 | 模型在易混淆类别上分辨力差,校准也差 | soft label 按"语义距离 / 标注者一致性"赋权,并保证 Σy=1 |
| 4 | 阶段 2 微调数据量不足 | 医疗只有几千条就想做微调 | 灾难性遗忘(通用任务掉点)或过拟合到领域口径 | 阶段 2 加 replay buffer(10% 通用数据),并监控 CJ-Bench 通用子集不掉点 |
| 5 | encoder 截断过长中文 | BERT 默认 512 token,长病历、长合同直接被截 | 关键条款、症状被切掉,决策错 | 用 longformer / BigBird backbone,或先做"长文档分块 + 段落级决策 + 聚合"两段式 |
| 6 | INT8 量化不验证 ECE | 上线后才发现阈值漂移 | 误判率上升、合规风险 | 量化前后必须做 ECE / reliability diagram 对比,且对每个垂直子集分别看 |
| 7 | 端侧 1 秒假设建立在中端手机 | 旗舰 SoC 测的 1 秒,到了低端机直接 3-4 秒 | 客服、合规初审这种"实时"场景体验崩溃 | 用真实机型分布做延迟基线,并在 SLA 里区分 P50 / P95 |
| 8 | 缺少 subgroup 偏差评估 | 医疗分诊在老年、女性、农村人口上系统性偏差 | 法律、医疗风险放大 | 强制要求 subgroup ECE、subgroup accuracy 报告,不达标禁止上线 |
九、与同方向工作的关系
- Jev(System-One 系列):直接继承,但本文显式把"中文"列为缺失场景。
- Lightweight text classification(FastText、BERT-family、DeBERTa-v3):本文把"分类任务 + 候选概率目标"框架正规化,并加了垂直领域两阶段训练视角。
- 中文 LLM(CPM、ChatGLM、Qwen):互补而非竞争——LLM 做开放生成,Chinese-Jev 做决策,二者可以级联:LLM 抽取候选 → Chinese-Jev 判定。
- On-device / 端侧推理(MNN、ncnn、llama.cpp、MNN-LLM):本文给出"决策任务也能端侧"的实证,可与端侧 LLM 互补。
十、适合谁读
- 中文 NLP 工程师 / 后端架构师:任何"文本 → 候选标签"的业务都值得读。
- 风控 / 合规 / 分诊 / 客服分流:这是 Chinese-Jev 的天然主场。
- 端侧 AI 产品经理:1 秒/决策、INT8、15 ms 三件套意味着新型产品形态。
- 值得一读的"非典型"读者:做 LLM 应用的人——当你下次准备用 LLM 做"分类"时,先停一秒,问一句"它真的需要生成吗?"
十一、一句话回顾
不是所有 NLP 任务都需要 LLM,能用概率目标解决的,就别让它自由生成——Chinese-Jev 给中文决策场景补上了这块被忽略的拼图。