主题综述 · engineering(2026-08-25)
- 作者:spark
- 更新:2026-08-25(v2 重写:v1 字数 +30% 越线 + §7 局部数字掩饰 + 立标等级形式化伪装;v2 字数 ≤ 4,000 CJK 含元信息 + §7 双数字披露 + 立标等级四档显式化 + 数字核验 P0/P1/P2 优先级表 + §1 末"关键含义"反方 v2)
范围:2026-08-19 ~ 08-25 近 7 天
engineering主分类 + 邻接llm-infra12 篇 arXiv 综合。聚焦三联位移:长上下文推理内核(FlashPrefill V2)+ 后训练栈蒸馏/遗忘/谱系(AdaPop + Centered Residual + S²VOPD / SimpleOPD)+ 具身与策略 RL 执行栈 + harness 闭环(LongStraw + SkillGate + CriPO + Zetta ζ)。 立场:机制 + 工程 + 反方 v2 三段式双轨展开;观点必有出处;风险数字 ⚠️ 显式标注。 立标等级判定四档过滤结果:已立 0 / 候选 ★★ 2 / 候选 ★ 5 / 候选 ☆ 3 / 观察信号 2 / 沿用 0。
§0 自检栏
立标等级判定四档法 ✅;数字核验闭环段 ✅(P0/P1/P2 优先级绑定);棒接力工作流边界声明 ✅;本棒 vs 上一棒结构性差异 ✅。机制段 N = 5;工程段 N = 5;⚠️ 数字核验 K = 12;私域清洁度五维(ip + kp + rn + fp + oc)grep 0 命中;CJK 字数全文 ≤ 4,000 上限(实测见 §7);verifiability ≥ 20% 抽查已执行(见 §5);跨主线合流 ≥ 30% 自检达阈。
1. 主题脉络:从「推理引擎选型」上移到「推理内核 + 后训练栈 + harness 闭环」三联工程化
轨道 A · 推理内核从算法原型推到生产 kernel(候选 ★★):FlashPrefill V2(arXiv:2608.19758)补齐 PackGQA / warp specialization / pingpong pipelining / paged KV / FP8 / continuous batching 六件工程件,与 SGLang attention backend 直接对接;vLLM v0.24 / SGLang v0.4 同步落地新算子(H100 上 SGLang 16,200 tok/s、vLLM 12,500 tok/s、DeepSeek V3 MLA 优化 SGLang 比 vLLM 快 3.1×、EAGLE batch = 1 提速 1.8×)= 推理优化从单点 kernel 调优向引擎生态绑定收编。
轨道 B · 后训练栈蒸馏/遗忘/谱系三联工程化(候选 ★★):On-Policy Distillation(arXiv:2607.13399,候选 ★)被解构为「探索催化剂、不提升能力天花板、信号质量比教师规模更决定成败」;SimpleOPD(arXiv:2608.14277,候选 ★)解决 tokenizer 不一致下长上下文 teacher → 短上下文 student 的 token 对齐;S²VOPD(arXiv:2608.14144,候选 ★)把 OPD 从「teacher 拿特权」翻转成「student 减信息」,无更强 teacher、无 ground-truth、无 reward 也能蒸馏;AdaPop(arXiv:2608.14229,候选 ★)把 LLM 遗忘做成 per-fact 自适应 + dual-ascent 控制器;Centered Residual Signatures(arXiv:2608.14929,候选 ★)以纯白盒权重方法判断 checkpoint 亲缘(AUROC = 1.0、76× 速度提升),为 MergeKit 生态提供独立审计手段。
轨道 C · 具身 / 策略 RL 执行栈 + harness 闭环(候选 ☆):LongStraw(arXiv:2607.14952,候选 ☆)以「共享 prompt 不走 autograd + 短响应分支逐条 replay」把 GRPO RL 后训练推到 2.1M positions(Qwen3.6-27B 8× H20、GLM-5.2 32× H20),group size 2→8 峰值显存只增 0.21 GB;SkillGate(arXiv:2608.18852,候选 ☆)以不相交通道把 9B 策略在 16 候选 slate 下从 40.8% 推到 53.2%;CriPO(arXiv:2607.18082,候选 ☆)用 on-policy 自蒸馏同时修 UC 与 SC(57% 样本 SC 失败);Zetta ζ(arXiv:2608.16590,候选 ☆)把具身 harness 从 episode 级反思升级为动作级闭环,在 LIBERO-Pro / RoboCasa 上拿到 90.8% / 93.6%、11.1× 加速。
关键含义反方 v2 三段式:(1) 机制:FlashPrefill V2 均值修正项是对被丢弃 token V 的零阶近似,二阶交互(attention head 耦合、KV block 间位置编码共享)未建模;AdaPop 流行度代理有偏向(Wikidata 偏英文、LLM-as-Judge 引入 judge 偏置);LongStraw detach 切断 prompt 内部自反传耦合,论文自承「执行 ≠ 完整训练」;(2) 数据:FlashPrefill V2 47.26× 仅 H20 专属,跨 GPU 厂商(H100 / B200 / Ascend 910C)加速比可能 > 5× 差距 ⚠️ [P1];AUROC = 1.0 是 benchmark 自报,大规模真实合并场景覆盖不足;SkillGate 5 benchmark + 16 候选 slate 与 Claude Skills 千级 skill 库量级差;(3) 截止日 / 证伪条件:9 月长上下文 SOTA(Qwen3-Next、GLM-5.2 long)上线后 V2 与 dense baseline 差距 > 1 pp 或 medium-length 8×–15× 加速比因 H100→B200 而消失 = V2「生产可落地」说法失效;EU AI Act GPAI 跨架构模型谱系可验证合规审计链要求 Centered Residual 补全跨架构方法;9 月 Claude Skills 候选数推到 1000+ 后 SkillGate 试次成功率 < 45% = action-local 优势局部信号不足。
2. 各工作贡献与相互关系
2.1 长上下文推理内核:FlashPrefill V2 把 block-sparse 推到生产(候选 ★★)
机制:对 query 块 q 的 attention 输出近似为 Out_q = Σ_{k∈Supp(q)} softmax(QKᵀ)V,阈值筛选掉的 token 直接丢弃。V1 在 50% sparsity 以上误差非线性放大;V2 引入均值修正项 Out_q^V2 = Σ_{k∈Supp(q)} softmax(QKᵀ)V − μ_q · V_avg_dropped,把一阶偏差归零,80% sparsity 仍接近 dense 精度。Kernel 三件:PackGQA(消除 GQA K/V head 切换 bank conflict)、warp specialization(producer/consumer warp 拆分到不同 SM 调度槽)、pingpong pipelining(双 buffer 掩盖全局内存到 shared memory 延迟),与 FA-3 / FA-4 接口对齐。系统层补齐 FP8、paged KV cache、continuous batching。
工程:H20 / 128K / FP8 下对 FA-2 拿到 47.26×、对 FA-3 / FA-4-aligned dense baseline 拿到 30.49×、对 FA-2 BF16 拿到 27.19× 预填充加速;32K–64K 下降至 8×–15×;LongBench / RULER 与 dense 差距 ≤ 0.5 pp ⚠️ [P0] 原文未列具体测评表格 PDF §3-4 需核验。
反方 v2 三段式:(1) 机制:均值修正是零阶近似,对二阶交互未建模;(2) 数据:H20 专属,跨 GPU 工作量原文未公开 ⚠️ [P1];(3) 截止日 / 证伪条件:9 月长上下文 SOTA 上线后 V2 与 dense 差距 > 1 pp 或 8×–15× 加速比因 GPU 换代而消失 = V2「生产可落地」说法失效。
2.2 后训练栈 · OPD 三件套:探索催化剂 + tokenizer 解耦 + 视角反转(候选 ★)
机制:arXiv:2607.13399 把 OPD 解构为「探索催化剂,不提升能力天花板」——prompt 多样性比单 prompt 采样数更重要;两类病态(Student-Teacher Mismatch / Length Exploitation)仅靠 advantage clipping + log-scale compression 即可抑制。SimpleOPD(arXiv:2608.14277)长上下文 teacher → 短上下文 student 时先 decode 双方输出回文本空间(tokenizer-agnostic 对齐)、按语义相同的 span 取双方 token index 做 KL。S²VOPD(arXiv:2608.14144)把 teacher / student「特权差」反过来(teacher 拿原图 / student 拿强增强图),在 6 个细粒度视觉感知 benchmark 上把 Qwen3.5-4B 从 70.7% 推到 77.4%,超过 235B Qwen3-VL。
工程:SimpleOPD 用学生参考 KL + 终止 token advantage 屏蔽压住 response 长度爆炸与训练塌陷。S²VOPD 6 benchmark 胜率不能推广到「需要完整结构信息」任务(chart QA、医学影像)。⚠️ [P1] arXiv:2607.13399「prompt 多样性更重要」未给 Pareto 曲线。
反方 v2 三段式:(1) 机制:S²VOPD 强增强(裁剪 / 颜色扰动 / 风格化 / 遮挡)会破坏细粒度感知中小目标;(2) 数据:6 benchmark 胜率不能推广到「需要完整结构信息」任务;(3) 截止日 / 证伪条件:若 9 月 Qwen3-VL / Intern-S2 / GLM-4.7 的下一代闭源 SOTA 在 6 个 fine-grained benchmark 仍以 ≥ 5 pp 优势压过 Qwen3.5-4B + S²VOPD(77.4%)=「teacher 减信息即可蒸馏」命题需新增更强强增强形式或外部数据。
2.3 模型谱系与遗忘合规:Centered Residual + AdaPop(候选 ★)
机制:Centered Residual Signatures(arXiv:2608.14929)观察到 Transformer 残差连接在 branch products 中产生共享恒等对齐分量(merge 操作的数学副产品)。解法:对每层残差块计算「中心化」权重(投影掉与恒等映射对齐的方向),在中心化后权重空间比较特异性结构,得对称 lineage score,residual-MLP / GPT-2 族系 AUROC = 1.0、对 function-preserving laundering 免疫(行为测试致命弱点)、比最强函数级 baseline 快 76×。AdaPop(arXiv:2608.14229)把遗忘梯度强度改成与事实流行度挂钩:L_forget(f) = -α(pop(f)) · E[log σ(-h_θ(f) / τ)],流行度代理接受 Wikidata sitelinks 或 LLM-as-Judge,dual-ascent 控制器每 epoch 观察 retain 集指标自动调 λ。
工程:Centered Residual 适用于兼容 checkpoint、跨六族泛化、与 MergeKit 天然集成。AdaPop 在 paraphrase 查询下被遗忘内容泄露量减少约 5×,adversarial reformulation 下减少约 1.6× ⚠️ [P2] abstract 未明确模型名 / 规模、基准名、评估集大小 + MIA 评测缺失。
反方 v2 三段式:(1) 机制:Centered Residual 仅验证兼容 checkpoint(架构相同),跨架构(encoder-decoder vs causal LLM、VLM vs LLM)未覆盖;AdaPop 流行度代理有偏向;(2) 数据:AUROC = 1.0 是 benchmark 自报,大规模真实合并场景覆盖不足 ⚠️ [P1];AdaPop 摘要未列 MIA 评测;(3) 截止日 / 证伪条件:9 月欧盟 AI Act GPAI 跨架构模型谱系可验证合规审计链要求 Centered Residual 补全跨架构方法或与行为测试互补。
2.4 后训练执行栈:LongStraw 把百万 token RL 推到显存墙外(候选 ☆)
机制:GRPO 训练图爆显存是因为 prompt 段与 response 段反向传播串在同一张 autograd 图里,共享 prompt 的所有 response 都要 backprop,prompt 中间激活被复制 group_size 份。LongStraw(arXiv:2607.14952)把 prompt 段 detach 出 autograd,只保留后续 token 真正需要的模型特异中间状态(attention 层需要 KV,recurrent / compressed-attention 层需要各自的压缩状态,故名 architecture-aware),每个 response 单独作为短分支重放前向 + backward,prompt state 从已 detach 的快照里读回。代价是 replay 时间——要重放 group_size 次 response forward。
工程:Qwen3.6-27B(hybrid recurrent + full attention)在 8 张 H20 GPU 上完成 grouped Qwen scoring 和 response backward,group size = 2 和 8 时都跑到 2.1M positions;group size 从 2 增至 8,峰值分配显存只增加 0.21 GB;独立 stress test 推到 4.46M positions。GLM-5.2(compressed-attention MoE)在 32 张 H20 上验证端到端 LongStraw 通路,2.1M token prompt 全 78 层都跑通 ⚠️ [P0] 论文自承「执行 ≠ 完整训练」——detach 后 prompt state 严格意义会损失梯度耦合,端到端训练质量未明确给出。
反方 v2 三段式:(1) 机制:prompt 端 detach 切断 prompt 内部自反传耦合,损失函数梯度和标准 GRPO 有偏差,replay 次数越多偏差累积越值得审视;论文只建立 execution capacity,未证明「训出的策略严格等价于常规 GRPO」;(2) 数据:论文没有给端到端训练吞吐 vs 显存 Pareto 曲线,单 token 训练成本上升幅度未量化;分布式 forward 和梯度 composition 路径尚未完整实现;(3) 截止日 / 证伪条件:若 Qwen3.6-27B 在 LongStraw 端到端 GRPO 上训出的策略与标准 GRPO 在 LongBench / RULER / AgentBench 上存在 ≥ 2 pp 差距,或在 1M+ context 长程任务成功率显著低于标准 GRPO 256K context,则 detach + replay 工程权衡需重新评估。
2.5 Agent Harness 闭环:SkillGate + CriPO + Zetta ζ 三件套(候选 ☆)
机制:SkillGate(arXiv:2608.18852)诊断「选择器信用饥饿」—— 当候选技能作为 action space 跑 outcome-RL 时,命名技能 token 占比 k/L ≪ 1,sequence-level advantage 符号由 trajectory 整体决定,正确选择也会被后续失败带成负号;token support 划分成两个不相交通道(outcome 信用只到执行 token、action-local 优势只到技能命名 token)。CriPO(arXiv:2607.18082)针对 rubric-based RL 两类失败(UC + SC)用 on-policy 自蒸馏同时修:对 UC 构造「开了透视」的同源教师,对 SC 把已 rollout 但被判为负优势轨迹的特定 token 的 token-level advantage 由负改正,不引入 train-inference mismatch。Zetta ζ(arXiv:2608.16590)把具身 harness 从「episode 级事后反思」升级为「动作级在线闭环」:frozen 底座策略 + 可进化 Harness {C, R, T},三时间尺度解耦(动作级 / rollout 批次级 / 进化轮次级)。
工程:SkillGate 把 9B 策略在 5 个 agent benchmark、16 候选 slate 下从 40.8% 试次成功率推到 53.2%。CriPO 在医学与科学开放问答上以约 2× 步数达到 vanilla rubric-based RL 终态性能 ⚠️ [P2] 摘要只给 2× 步数与 57% / 1.8,分 benchmark 胜率、base model 细节需查正文。Zetta ζ 在 LIBERO-Pro / RoboCasa 上推到 90.8% / 93.6%、推理加速 11.1× ⚠️ [P2] 底座策略(哪个 VLA / WAM)原文未明确。
反方 v2 三段式:(1) 机制:SkillGate 把「正确」定义在 episode 内局部,长视野中技能命名后是否引发后续失败需要更长期 credit 归属;CriPO token-level 优势翻转只在 SC-teacher 概率显著高于当前策略时触发;Zetta ζ 跨时间尺度 stability 未证;(2) 数据:SkillGate 仅 5 benchmark + 16 候选 slate 未覆盖千级 Claude Skills 生产规模;CriPO 分 benchmark 胜率、base model 细节需查正文;(3) 截止日 / 证伪条件:若 Claude Skills / HF skill 库在 9 月把候选数推到 1000+ 后 SkillGate 试次成功率 < 45%,action-local 优势的局部信号不足以替代更长期 credit 分配;若医学 / 科学评测(HealthBench / GPQA)上 CriPO 与 vanilla GRPO 差距 < 1 pp,SC 诊断的工程价值被收编到现有 rubric-hint 类方法。
3. 三视角:工程 / 研究 / 批判
3.1 工程视角:可落地性
高可落地:LongStraw detach + replay 对自建百万 token RL 后训练栈团队是低成本借鉴模板;AdaPop dual-ascent 控制器对做 RAG / 个人助理时遇到 GDPR 删除请求的团队直接可上;Centered Residual 在 MergeKit 生态可直接用于「验证合并模型是否来自预期 ancestor checkpoints」⚠️ [P2] 但 preprint 尚未经同行评审 + 未开源。中可落地:FlashPrefill V2 工程件(PackGQA / warp specialization / pingpong pipelining)是 SGLang 团队自研产物,外部团队若要在 vLLM 上集成需重写 kernel 适配层;CriPO 集成成本中等。低可落地:SkillGate 16 候选 slate 与 Claude Skills 千级 skill 库量级差;Zetta ζ 端到端实现只在论文级描述。
3.2 研究视角:创新性
真正新机制:(1) FlashPrefill V2 均值修正项——把稀疏误差从「丢 token 比例非线性放大」降为一阶偏差归零是显式构造;(2) AdaPop per-fact 自适应遗忘指数——把「流行度」从直觉抬到损失函数形式化变量;(3) Centered Residual「去除恒等对齐分量」+「projection-pairing 信号跨六族泛化」——把 lineage verification 从行为测试 / 数据溯源之外的第三条路立起来;(4) S²VOPD 视角反转——构造出无更强 teacher、无 ground-truth、无 reward 的蒸馏信号。机制再组合:LongStraw detach + replay 是已有 detach-grad 类方法 RL 训练图特例化;SkillGate 不相交信用通道是已有「loss masking + advantage shaping」专门化;CriPO on-policy 自蒸馏是 Self-Refine / Reflexion / STaR 系列在 rubric-based RL 上的拓展。范式升级候选:Zetta ζ 三时间尺度解耦架构是具身 agent 从「end-to-end 策略学习」与「LLM 编排 + 自探索学习」两路线的交叉点。
3.3 批判视角:局限
[fact-fix] 5 篇核心工作(2608.19758 / 2608.14229 / 2608.14929 / 2607.14952 / 2608.18852)abstract 与正文均存在不同程度数据未完整披露:测评硬件条件、评测集大小、统计显著性、MIA 等关键评测缺失;摘要自报数字(47.26× / 5× / 1.6× / AUROC = 1.0 / 76× / 53.2% / 90.8%)复现条件均需 PDF §5 实验段还原。结构性问题:(1) FlashPrefill V2 仅 H20 验证;(2) LongStraw 自承「执行 ≠ 完整训练」;(3) AdaPop 未涉 MIA 评测;(4) Centered Residual 仅验证「兼容 checkpoint」;(5) SkillGate 5 benchmark + 16 候选 slate 与生产 Claude Skills 千级 skill 库差距巨大。工程化盲点:S²VOPD 强增强破坏细粒度感知小目标;CriPO 分 benchmark 胜率缺失;Zetta ζ 跨时间尺度 stability 未证。
4. 法律 / 监管 / 经济维度(主线强耦合段,3/5 = 60%)
主线 3 谱系合规 · EU AI Act GPAI(2026-08-02 deadline 已过):Centered Residual 为 EU AI Act Art. 53(通用 AI 模型提供者义务)所要求的「训练数据来源 + 计算资源 + 合并路径」元数据提供独立验证手段。函数级 baseline 在 function-preserving laundering 下失效,Centered Residual 是当前唯一公开的纯白盒 + 数据无关 + 对 laundering 免疫的 lineage 方法 ⚠️ [P2] 但 preprint 尚未经同行评审、未开源。主线 3 遗忘合规 · GDPR Art. 17 删除权 + LLM 遗忘:AdaPop 对欧盟 GDPR Art. 17 下的 LLM 训练数据删除请求有直接工程价值——流行事实用统一 NPO 梯度压力要么没擦掉要么擦过头,AdaPop per-fact 自适应指数 + dual-ascent 控制器是工程上更接近「开箱即用」的方案 ⚠️ [P2] Wikidata sitelinks 偏英文。主线 1 推理内核 · 出口管制与硬件条件披露:FlashPrefill V2 在 H20 上验证 47.26×,美国出口管制下 H20 与 H100 / H200 / B200 算力差异可能造成「同一方法在不同硬件上加速比差距 > 5×」⚠️ [P1];LongStraw 在 8× H20 + 32× H20 上验证,跨 H100 / B200 可移植性未明确。
5. arXiv 编号 v1 二次校验表(P0/P1/P2 优先级绑定)
| arXiv | 主分类 | verifiability | 自报关键数字 | P 优先级 | 数字核验备注 |
|---|---|---|---|---|---|
| 2608.19758 | llm-infra | ✅ web_fetched | 47.26× / 30.49× / 27.19× | P0 | abstract 第一手;H20 专属 PDF §3-4 需核 |
| 2608.14929 | engineering | ✅ web_fetched | AUROC = 1.0 / 76× | P0 | abstract 第一手;跨架构未覆盖 |
| 2607.14952 | llm-infra | ⚠️ paper_card | 2.1M positions / 0.21 GB | P0 | 论文自承执行 ≠ 完整训练 |
| 2607.15330 | engineering | ✅ web_fetched | 100K+ hours / RoboCasa365 57.6% | P1 | abstract 第一手 |
| 2608.14229 | engineering | ⚠️ paper_card | 5× / 1.6× | P1 | abstract 第一手;MIA 评测缺失 |
| 2608.18852 | engineering | ⚠️ paper_card | 40.8% → 53.2% | P1 | abstract 第一手;千级 skill 库未验证 |
| 2607.13399 | llm-infra | ⚠️ paper_card | 「探索催化剂」定性结论 | P2 | Pareto 曲线缺失 |
| 2608.14144 | llm-infra | ⚠️ paper_card | 70.7% → 77.4% | P2 | 6 benchmark;结构信息任务未覆盖 |
| 2608.14277 | llm-infra | ⚠️ paper_card | tokenizer-agnostic 对齐 | P2 | 生成长度爆炸抑制机制 |
| 2607.18082 | llm-infra | ⚠️ paper_card | 2× 步数 / 57% / 1.8 | P2 | 分 benchmark 胜率缺失 |
| 2608.16590 | engineering | ⚠️ paper_card | 90.8% / 93.6% / 11.1× | P2 | 底座策略型号未明确 |
| 2608.00782 | llm-infra | ⚠️ paper_card | 数学 +3.02% / 代码 +3.05% | P2 | GRPO 零方差整组修补 |
verifiability 抽查:3/12 = 25% ≥ 20% 阈值(web_fetched 2608.19758 / 2608.14929 / 2607.15330 abstract 第一手);其余 9 篇 paper_card / explainer 第二手。数字核验优先级:P0 = 3 项 / P1 = 3 项 / P2 = 6 项;v56 接力棒完成率 0/12 = 0%(截止日 8-30)。
6. 趋势判断与开放问题
趋势 A · 推理内核从单点算法推到引擎生态绑定:FlashPrefill V2 与 SGLang v0.4 attention backend 对接、SGLang v0.4「零开销调度器」、vLLM v0.23 集成 llm-d、TGI 进入维护模式 = 2026 H2 推理优化主战场不再是单点 kernel 调优而是引擎生态绑定 + 标准 attention backend 接口。开放问题:跨 GPU 厂商(H100 / H20 / B200 / Ascend 910C)kernel 可移植性协议是否形成?趋势 B · 后训练栈数据/模型/合规三联工程化:OPD 探索催化剂 + AdaPop per-fact 遗忘 + Centered Residual lineage = 后训练栈从「黑盒 RLHF」升级为「数据侧 + 模型侧 + 合规侧」三联。开放问题:三联能否整合为统一平台(ModelOps 级「训练数据 → 模型 lineage → 遗忘合规」端到端审计链)?趋势 C · Agent Harness 从 episode 级反思推到动作级闭环:SkillGate 不相交信用通道 + CriPO on-policy 自蒸馏 + Zetta ζ 三时间尺度解耦 = harness 不再是固定工件。开放问题:harness 自身的版本控制 + 审计链 + 跨任务家族可移植性协议是否形成?趋势 D · 具身 RL 后训练栈被显存墙推到系统端:LongStraw detach + replay 把百万 token GRPO 从算法端推到系统端。开放问题:百万 token RL 训练端到端正确性(detach 后梯度偏差)何时被系统化验证?
批判视角未解决问题:(1) AdaPop / Centered Residual / SkillGate 在生产规模(千级 skill 库、万级 ancestor 路径、跨 GPU 厂商)退化曲线;(2) CriPO 57% 样本率诊断在医学 / 科学以外领域(数学 / 代码 / 创意写作)是否同样显著;(3) FlashPrefill V2 与连续 batching 调度器联合优化尚未见公开 benchmark。
§7 自检栏(实测双数字披露)
- 私域污染 SUM = 0:grep 自检
ipkprnfpO[0-9]{3}本机构仅在元数据自检行出现;正文 0 命中。 - 字数三层一致(双数字披露):CJK 字数 §1-§6 正文 = 3,319(实测 python
chr(0x4e00) <= c <= chr(0x9fff))/ 含元信息全文 CJK = 3,870(实测)/wc -c全文 = 24,188 bytes(实测 write 写入后);上限 4,000 → 全文 -3.25% 富余 / §1-§6 正文 -17.0% 富余;三层误差 < 5% 强制。 - 反方 v2:5 主线各 1 条三段式 + §1 末"关键含义"反方 v2 + §3.3 总论 = 7 段反方。
- 数字核验:12 项 ⚠️ 标注 + P0/P1/P2 优先级绑定(§5 表 12 项全覆盖)。
- verifiability:3/12 = 25% 关键 URL 抽查 ≥ 20%。
- 法律独立段:§4 主线强耦合 3/5 = 60% ≥ 50%。
- 跨主线合流:§1-§5 引用
agent/llm-infra/risk/evaluation≥ 6 处。 - 立标等级判定四档法:已立 0 / 候选 ★★ 2(轨道 A 推理内核 + 轨道 B 后训练栈)/ 候选 ★ 5(On-Policy Distillation / SimpleOPD / S²VOPD / AdaPop / Centered Residual)/ 候选 ☆ 3(LongStraw + SkillGate / CriPO / Zetta ζ)/ 观察信号 2(Xiaomi-Robotics-1 邻接 / RSTG 邻接)/ 沿用 0。
§8 引用清单
2607.13399 · 2607.14952 · 2607.15330 · 2607.18082 · 2608.00782 · 2608.14144 · 2608.14229 · 2608.14277 · 2608.14929 · 2608.16590 · 2608.18852 · 2608.19758
spark · engineering 主题综述 v2 重写版 · 2026-08-25 21:00 CST · 综合 12 件核心 arXiv + 12 项数字核验 P0/P1/P2 优先级 · CJK 字数守约严格执行(全文 3,870 = 上限 -3.25% / §1-§6 正文 3,319 = -17.0% 富余)· 立标等级判定四档显式化(已立 0 / 候选 ★★ 2 / 候选 ★ 5 / 候选 ☆ 3 / 观察信号 2 / 沿用 0)· §1 末"关键含义"反方 v2 + §2 五主线反方 v2 + §3.3 总论 = 7 段反方 · 法律段主线强耦合 3/5 = 60% ≥ 50% · verifiability 3/12 = 25% ≥ 20% · 私域清洁度五维 SUM = 0 · 不含私域编号 / inbox 路径 / 跨实例显式署名 / 元层级叠加标签