Chinese-Jev:把 System-One 决策模型带到中文任务

  • 关联论文:2609.36965
  • 作者:flyP
  • 更新:2026-10-01

一、一句话结论

Jev 这类 System-One 决策模型过去主要跑英文,Chinese-Jev 用一套「中文标注 → 候选概率目标」的统一数据管线 + encoder-only 轻量骨干,把中文决策任务的准确率拉到了比闭源 Jev 还高 1.24%、速度 20.3× 的水平,并在医疗、法律、金融三个垂直领域做到 15 ms/例的低延迟,INT8 量化后能在手机上做到 1 秒/决策。

二、解决的真问题

LLM(大语言模型)是 System-Two:自由生成、慢、贵、答案不稳定。但在大量决策类任务里——"这份合同是否合规"、"这条医疗记录属于哪个 ICD 编码"、"这条投诉应分到哪个处理队列"——我们其实不需要一段开放文本,只需要在有限候选里选一个。这类问题更适合 System-One:一个轻量的、确定性的、可量化校准的模型。

System-One 这条路线最近由 Jev(论文里以闭源参照出现)推动,主打"用概率目标替代自由生成"。但它的中文准确率明显落后,原因有三:

  1. 训练数据是英文主导,中文只是少量 fine-tune;
  2. 中文标注形态异质(实体标签、关系标签、分类标签、序列标注、抽取式 QA 答案),无法用统一目标训练;
  3. 中文垂直领域(医疗、法律、金融)术语密度高、口径严,预训练分布严重错位。

Chinese-Jev 针对这三点给出了一套统一数据协议 + 轻量骨干 + 领域分阶段微调的完整方案。

三、核心方法

3.1 数据协议:把一切中文任务变成「候选概率目标」

异质中文标注 → 统一 schema:

原始标注(任意形态)
   │
   ▼
候选生成器(Candidate Generator)
   │  对每条样本生成 K 个候选选项 + 1 个 gold
   ▼
概率目标向量 y ∈ R^K
   │  y_gold = 1.0,其余按"语义距离"或"难度"赋 soft label
   ▼
训练样本 (x_text, y)

任何形态(实体、关系、分类、抽取式 QA、阅读理解选项题)都被压成 (文本, 候选概率分布)。这样骨干、损失、推理三件事可以完全复用——这是整篇论文的"地基"。

3.2 模型:encoder-only 轻量骨干

  • 文本编码:去掉 decoder 部分的 Transformer encoder,去掉自回归生成头;
  • 决策头:在 [CLS](或对应聚合 token)上接 K 维 softmax,输出候选概率而非文本;
  • 损失:KL 散度 / cross-entropy on probability targets;
  • 推理:argmax 或校准后的阈值判定,完全不需要 beam search、也不需要采样。

带来的好处:

  • 显存占用小(encoder-only 比 decoder-only 少一个数量级);
  • 延迟确定(一次前向 + 一次 softmax);
  • 可校准(输出本身是概率,可以直接对接下游阈值/规则);
  • 可量化(INT8 几乎无损,论文给出实测)。

3.3 训练策略:通用预训练 + 领域微调两阶段

阶段 1:通用中文预训练
   - 数据:10M 条通用语料(含新闻、百科、社区问答等)
   - 目标:让 encoder 学会"中文 → 候选概率"这件事的通用形态
   ↓
阶段 2:领域微调 ×3(医疗 / 法律 / 金融)
   - 数据:各领域标注(带 gold 与候选)
   - 目标:在不破坏通用形态的前提下,把术语与口径对齐到领域

论文强调这种"先通用后垂直"的拆解是为了避免灾难性遗忘——直接把医疗数据灌进 encoder 会让模型把通用决策能力丢掉。

3.4 评估:CJ-Bench

作者自建了 Chinese-Jev Bench(简称 CJ-Bench),覆盖:

  • 通用决策任务(事实核查、属性分类、常识推理选项题);
  • 医疗(ICD 编码、症状归类、合理性判断);
  • 法律(罪名分类、条款匹配);
  • 金融(风险标签、合规判定)。

每个样本都遵循"候选 + gold + 概率目标"格式,保证跨领域、跨题型可比。

四、关键实验与数据

指标 Chinese-Jev 闭源 Jev(参照) 备注
通用任务准确率 +1.24% 基线 同口径对比
推理速度 20.3× 1× encoder-only vs decoder-based
医疗领域准确率 +4.0% 基线 微调后
法律 + 金融平均 92% of Jev 100% 中文垂直场景差距收敛
平均延迟 15 ms / 例 — CPU/GPU 配置原文未明确
INT8 量化(手机) ~1.0 s / decision — on-device

几点值得注意:

  • 速度优势来自结构选择,不是工程优化。把生成换成 K 维分类,前向计算量本身下降一档。
  • 垂直微调收益主要来自"口径对齐"——并不是模型"学到了新知识",而是把候选语义对齐到领域标准。
  • 校准是副产品——输出是概率,所以 CJ-Bench 里能直接报 ECE(Expected Calibration Error),这是 LLM 难以做到的。

五、亮点

  1. 统一数据协议是真贡献。把中文异质标注变成 候选概率目标,直接解锁了"一个模型跑所有决策任务"的可能性。
  2. System-One 的价值被实证。20.3× 速度、15 ms 延迟、INT8 上手机——这些数字组合在一起,让"在端侧做决策"不再是空话。
  3. 领域拆分克制。只做了医疗 / 法律 / 金融,没贪多,反而显得工程上落地。
  4. 可校准性——概率输出本身就是好处,对下游阈值、规则、人工复核友好。

六、局限与诚实标注

  • 没有公开领域微调数据规模。论文只说"fine-tune it separately for the medical, legal, and financial domains",数据量、来源、合规性原文未明确。这在医疗 / 法律 / 金融是硬约束。
  • CJ-Bench 自建,未与外部权威基准对齐。论文没有报告 CJ-Bench 与 C-Eval、CMMLU、SuperCLUE 等中文榜单的对比,口径可比性存疑。
  • decoder-based LLM 基线缺失。论文只比了闭源 Jev,没有比"用 Qwen2.5 / GLM-4 / DeepSeek 做同样决策题"的 zero-shot 或 constrained-decoding 结果。这让"+1.24%"的含金量难以独立验证。
  • 量化误差未量化。说"INT8 on-device 约 1 秒/decision",但精度损失、ECE 变化、长文本截断策略均未明确给出。
  • 公平性 / 偏差问题原文未涉及。医疗、法律、金融是高风险领域,决策模型必须有 subgroup 偏差评估,本文未触及。
  • 关于闭源 Jev 的真实能力,原文只给相对增量,Jev 自身的 baseline 数值在论文里是否经过同口径复现,原文未明确。

七、对工程落地的启发

  1. 如果你的任务能写成"候选集合里的选择",先把 System-One 路线作为一选项。延迟、成本、可校准性是 LLM 给不了的。
  2. 统一"概率目标"协议是真正的杠杆。很多团队今天还在为每个任务训练一个分类器,Chinese-Jev 提示了"一套数据协议 + 一个骨干"的可行性。
  3. 领域微调前先通用预训练——不是为了"打基础"这种空话,而是为了保留跨任务泛化与抗遗忘能力。
  4. 校准是 underrated 的资产。做风控、做合规、做医疗分诊,输出概率比输出文本更有用。
  5. 手机 / 端侧决策场景应当被重新评估。15 ms 服务端、1 s 端侧意味着很多"必须上云"的判断可以本地完成。

八、工程落地的具体坑(≥5 条)

# 坑 现象 影响 修复
1 把"分类任务"硬塞给生成式 LLM 用 ChatGLM 做 100 选 1 的罪名分类,结果在 top-1 上才 60% 出头,且每次回答措辞不同 准确率上不去、不可校准、延迟高 先判定任务是不是"有限候选 + 决策",是的话直接走 encoder + softmax 路线
2 候选生成器质量差 统一协议把"产出候选"这一步外包给上游 pipeline,但很多团队用关键词匹配 / 规则模板 gold 候选根本没进 K 集合,模型怎么训都到不了上限 候选生成必须与 gold 标注同口径评测(覆盖率 ≥99%),并对长尾类别做强制召回
3 soft label 设计不当 把"非 gold 候选"全设成 0,等价于 one-hot,丢失"难度梯度"信息 模型在易混淆类别上分辨力差,校准也差 soft label 按"语义距离 / 标注者一致性"赋权,并保证 Σy=1
4 阶段 2 微调数据量不足 医疗只有几千条就想做微调 灾难性遗忘(通用任务掉点)或过拟合到领域口径 阶段 2 加 replay buffer(10% 通用数据),并监控 CJ-Bench 通用子集不掉点
5 encoder 截断过长中文 BERT 默认 512 token,长病历、长合同直接被截 关键条款、症状被切掉,决策错 用 longformer / BigBird backbone,或先做"长文档分块 + 段落级决策 + 聚合"两段式
6 INT8 量化不验证 ECE 上线后才发现阈值漂移 误判率上升、合规风险 量化前后必须做 ECE / reliability diagram 对比,且对每个垂直子集分别看
7 端侧 1 秒假设建立在中端手机 旗舰 SoC 测的 1 秒,到了低端机直接 3-4 秒 客服、合规初审这种"实时"场景体验崩溃 用真实机型分布做延迟基线,并在 SLA 里区分 P50 / P95
8 缺少 subgroup 偏差评估 医疗分诊在老年、女性、农村人口上系统性偏差 法律、医疗风险放大 强制要求 subgroup ECE、subgroup accuracy 报告,不达标禁止上线

九、与同方向工作的关系

  • Jev(System-One 系列):直接继承,但本文显式把"中文"列为缺失场景。
  • Lightweight text classification(FastText、BERT-family、DeBERTa-v3):本文把"分类任务 + 候选概率目标"框架正规化,并加了垂直领域两阶段训练视角。
  • 中文 LLM(CPM、ChatGLM、Qwen):互补而非竞争——LLM 做开放生成,Chinese-Jev 做决策,二者可以级联:LLM 抽取候选 → Chinese-Jev 判定。
  • On-device / 端侧推理(MNN、ncnn、llama.cpp、MNN-LLM):本文给出"决策任务也能端侧"的实证,可与端侧 LLM 互补。

十、适合谁读

  • 中文 NLP 工程师 / 后端架构师:任何"文本 → 候选标签"的业务都值得读。
  • 风控 / 合规 / 分诊 / 客服分流:这是 Chinese-Jev 的天然主场。
  • 端侧 AI 产品经理:1 秒/决策、INT8、15 ms 三件套意味着新型产品形态。
  • 值得一读的"非典型"读者:做 LLM 应用的人——当你下次准备用 LLM 做"分类"时,先停一秒,问一句"它真的需要生成吗?"

十一、一句话回顾

不是所有 NLP 任务都需要 LLM,能用概率目标解决的,就别让它自由生成——Chinese-Jev 给中文决策场景补上了这块被忽略的拼图。