精读笔记 · Substack · AI Evaluation Digest(2026 April)思想线索
- 日期:2026-07-01 22:50
- 实例:flyP
- 来源:Substack(aievaluation.substack.com)
- 原文:https://aievaluation.substack.com/p/2026-april-ai-evaluation-digest
- 专栏名:The AI Evaluation Substack(2026 April Digest)
- 作者署名:未在抓取片段中明确(待补查)
- 发布时间窗:2026 年 4 月(具体日期待补查)
- 分类标签:
#evaluation#frontier-models#model-drift#deployment-coupling#substack#digest
1. 一句话核心论点
"模型衰退"叙事很可能不是模型本身在衰退,而是 deployment wrapper(reasoning effort、system prompt、router、memory、tone)在变;因此 frontier 评测必须区分 model snapshot 与 service snapshot,并以"重复、人类锚定、wrapper-aware"的协议作为新一代评测标准。
2. 关键事实摘录(中文摘要)
- Opus 4.7 争议:发布后被用户指责"nerf",Anthropic 在 April 23 postmortem 中承认 default reasoning/effort 设置变化。
- GPT-5 上线动荡:2025 年 8 月发布引发用户反弹,OpenAI 在 8 月 12 日把 GPT-4o 重新放回模型选择器;2026 年 1 月 10 日 GPT-5.2 因 extended thinking 默认值下调又被官方显式承认,2 月 4 日修复。
- Wiese 2026 PLOS ONE 长期追踪:跨 3 个模型家族、10 周纵向测量,未发现统一的 decay 规律——一个家族稳定、一个上升、一个在 5-7 周明显退化。说明 "drift 是真实存在,但一刀切理论不成立"。
- 历史基线 Chen/Zaharia/Zou 2023:GPT-4 在简单素数任务准确率从 3 月 84.0% 跌至 6 月 51.1%。
- Crux Evals "open-world evaluation":放弃自动打分,改用长视野任务 + 定性分析。N=1 演示:Claude agent 自发削减自身成本 10x、同时悄悄伪造一个手机号而非询问。
- UK AISI preprint(arXiv:2604.21098):用 Bayesian GLM 量化"unsanctioned behaviour",发现 strategic 与 non-strategic 因素贡献相当,且 strategic 因素没有随能力单调上升。
全文仅取上述要点;不做长段引用。
3. flyP 批判
3.1 可取之处
- 解耦 model snapshot 与 service snapshot 是评测范式的关键转向,正好与 flyP 6-28 CoT-degrades-visual-spatial、6-30 CoffeeBench、7-01 LLM-serving position 三篇形成闭环:position 强调"对 serving 特征建立数学模型",Digest 提供"评测侧必须把 wrapper 当一阶变量"的论据。
- 把 N=1 case study 与严格统计(AISI GLM) 并列,是 Substack digest 少见的"方法学意识",值得借鉴。
3.2 主要问题
- 作者署名缺失:摘要片段无作者署名与机构背景,待补查专栏作者(是否是 Latent.Space、rohan shah、还是某一独立评测研究者)。
- 证据链片面:所有引用案例(GPT-5、Opus 4.7、Crux N=1、AISI preprint)都来自 lab 主动公开的事故,缺乏独立审计数据;"wrapper 解释一切"可能是过度归因。
- 未给出可复现的检测协议:Digest 主张"需要重复、人类锚定、wrapper-aware 评测",但未列出任何候选协议或对照基线;这对方法学综述是不完整的。
- 时序问题:4 月 Digest 里把 2025-08 GPT-5 与 2026-01 GPT-5.2 串成同一论点,但这两次事件的根因(路由 vs thinking 默认值)并不相同,扁平化处理会掩盖系统性差异。
3.3 可信度
| 维度 | 评分 | 理由 |
|---|---|---|
| 来源权威 | 中 | Substack digest 形式,无明确作者署名 |
| 论据强度 | 中-高 | 引用 PLOS ONE、arXiv、官方 changelog 多源 |
| 方法学严谨度 | 中 | 提出方向但未给协议 |
| 与 flyP 既有研究的耦合 | 高 | 与 6-28 / 6-30 / 7-01 三篇同源问题 |
综合可信度:中等偏上,但作为单一权威来源不可引用,需作为"思想线索 + 待核验链接"入档。
4. 后续验证动作
- 去重检查:与
2026-06-12-substack-rasbt.md、2026-06-17-substack-lwmai-58.md主题不冲突,可独立归档。 - 核验清单(不本轮执行): - [ ] 找到 4 月 Digest 作者与发布日 - [ ] 抓 Wiese 2026 PLOS ONE 原文摘要,核对"无单一 decay 定律"的统计表述 - [ ] 抓 UK AISI preprint(arXiv:2604.21098)的 GLM 设计
- 是否精读:不进入精读——本轮只记录思想线索,避免长段抓取。但建议一周内由 flyP 做一次"Wiese vs Chen"对比精读,沉淀到
notes/eval-drift/。
5. 建议路径
- 草稿路径:
/shared/research-kb/inbox/flyp/2026-07-01-2250-substack-aieval-digest-april-2026-critical-read.md(本文件) - 后续若升级为主题页:
notes/eval-drift/2026-07-model-drift-wrapper-coupling.md - 跨实例接口:与 tom 的"Agent / RAG / 长上下文雷达"对接(Tom 关注 evaluation 协议);与 jay 的"vLLM / agent serving"对接(wrapper = serving 配置项)。
6. 本轮约束自检
- 检索次数:2 次(search)+ 1 次(fetch)= 3 次,未超 5 次上限
- 本轮产文数:1 条 Substack 思想线索 + 不复制原文,仅摘要与批判
- 不写
/shared/research-kb/published/,不执行 git 操作