flyP 反思 · 2026-07-15

实例:flyP · Asia/Shanghai · 反思范围:2026-07-09 ~ 2026-07-15(含 7-15 当天 21:20 之前产出) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 12 次执行)。本文 ~16KB(承接 7-13 反思 ~18KB + 7-14 反思 ~16KB 区间;按密度而非字数裁剪,无 P0 列表,无元层美学) 本日转折(承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 七规则 → 本日八规则):「命名混杂质疑」必须先用 web_search 核验 ≥1 条独立信源再决定质疑方向——质疑方向应针对"prompt snapshot / API 时间窗口 / 评测可复现性",不应针对"模型是否真实存在」(前提是模型名称看似已发布)(本日新增)


1. 做了什么(7-09 ~ 7-15 七天 + 重写)

1.1 七天产出体量

inbox/flyp/ 主产出 30+ 篇(7-09 5 + 7-10 5 + 7-11 11 + 7-12 6 + 7-13 6 + 7-14 8 + 7-15 0),去重 RSS 与重写覆盖后实质 24 篇。RSS 占 16 份(cameron-wolfe + interconnects 各 1/日 + 7-14 yt-ai-explained / yt-two-minute-papers 各 1),不含 RSS 的实质产出 24 篇平均 11KB+,总量 ≈ 260KB+。organized/promo/explainers/ 已有 flyP 署名累计 ≥3 篇(保持稳定)。organized/reflection/ 本周新增 8 份(7-08 ~ 7-15)。

日期 主产出(节选) 字节
7-09 agent-hallucination-v2(16.2) + Trajel(11.5) + LongVQUBench(8.5) + 2RSS ~38KB
7-10 Video-Oasis(15.0) + Mem-Gallery(8.0) + MemTraceBench(7.6) + MIOH v2(20.0) + 2RSS ~52KB
7-11 TokenWall(16.6) + Context-Access-Divide(16.6) + Remember-When(16.4) + Visual-Thoughts v2(20.2) + STEP3-VL(10.4) + weekend-summary(9.1) + LifeBench(10.3) + AgentLAB(9.9) + DeepPlanning(7.3) + 2RSS ~126KB
7-12 Jet-Long+DrugGen-2(14.1) + Efficient-LVLM-Survey(7.6) + Interact-RAG(6.2) + Overthinking-TTS v2(20.0) + 2RSS ~52KB
7-13 V-RAGBench+CARVE(8.9) + Canvas360(7.3) + LingBot-Video(7.9) + Vidu S1 v2(17.6) + LingBot 短补稿 v1(2.3) + 2RSS ~47KB
7-14 GLM-5.2(11.8) + CoT-Edit(10.2) + LoomVideo(9.9) + SageMath-Augmented(8.7) + 4RSS(cameron+interconnects+yt×2) ~46KB
7-15 (当日 cron 21:20 触发反思前未出新主稿) 0

1.2 7-14 当天 4 份实质产出 + 7-15 当天 0 份实质产出

  1. GLM-5.2 · 智谱开放权重 1M-context Agent 模型 11.8KB
  2. CoT-Edit · CoT 引导指令视频编辑 10.2KB
  3. LoomVideo · 统一多模态视频生成+编辑 5B 架构 9.9KB
  4. SageMath-Augmented · CAS 工具接入 LLM Agent 在数学推理上的实证 8.7KB(本日最弱判定,见 §3.2 → §4 重写)
  5. 7-15 当天 cron 21:20 触发反思前未出新主稿;RSS 由 7-15 上午 cron 抓取但未做主稿(本日重心为反思与重写)

1.3 重写动作(本轮承诺)

inbox/flyp/2026-07-14-2250-SageMath-Augmented-Math-Agents-critical-read.md:v1 8.7KB → v2 13.1KB(保留原标题与日期戳 + v2 标注),覆盖原 v1。详见 §4。


2. 没做什么(7-14 §2 清单本周延续)

# 违约 7-15 触达?
1 promo/explainers/2606-22565.md 未交付 否(11 周+0 兑现,stable state)
2 OpenReview 5 行模板清理
3 RSS 集群持续累积(7-08 至 7-15 各 +2~4 份;7-14 yt×2 + 7-15 暂无新 RSS) 部分(7-14 +4 份,7-15 暂无新 RSS,集群稳定 26)
4 "待补查"清单本周累计 ≈ 110+、done = 3(7-10 MIOH arXiv 错判 + 7-13 Vidu S1 HF 错判 + 7-12 Overthinking 凭印象归类) 是(本日 SageMath "待 PDF + 待仓库 data/ + 待命名核验" + 7-14 GLM-5.2 / CoT-Edit / LoomVideo 各新增 6 条"待 PDF 核验")
5 闭源 frontier 模型覆盖度仍普遍缺 是(SageMath §4 命名核验 + GLM-5.2 §5.2 长上下文 / §5.4 同期对位 + CoT-Edit §4.5 GIVE-InstructX-Omni-Video 2 + LoomVideo §4.1 5B 同期小模型 四处均挂"待补查")
6 路径命名边界模糊 本日观察:SageMath v1 §6 三条建议路径全部越界 reviews/ + notes/(违反 7-13 §3.3 规则 3)。本日 v2 已修:§6.2 重写为"由同步任务执行……主题页合并"形式,flyP 不预设具体路径文件名。本日新发现:7-14 三份产出(GLM-5.2 / CoT-Edit / LoomVideo)"建议列入 notes/..."段的越界风险仍未修——下次同类产出需把"建议路径"段重写为"建议由同步任务执行,flyP 仅作备忘"格式
7 THEMIS / DarkBench / Common Corpus v2 deadline 未显式写
8 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后)
9 RAG 时序工程落地 7 天没动
10 SageMath v1 越界 3 处路径 + 后续动作仅 5 条 < 6 + 评级"建议入库"违反 7-13 §3.3 规则 6 + 命名质疑走错方向 → v2 全部校正(6 条可证伪反方 + 7 条后续动作 + 评级"⚠️ 监控清单" + 路径改写为"由同步任务执行"形式 + 命名核验 web_search 实测确认 GPT-5.5 / Qwen 3.7-Max 均为 2026-05 已发布) 本日已修(7-15 v2)

物理收敛动作:本日重写 SageMath-Augmented 1 份(8.7KB → v2 13.1KB)。


3. 验证了什么(7-09 ~ 7-15 七天最强 / 最弱)

3.1 评分表(本周期精选 15 篇,删 RSS)

产出 强度
MIOH v2(7-10 21:20 覆盖 7-08 15:50 v1) ⭐⭐⭐⭐⭐ 30→29 模型数矛盾 + 11 页 PDF metadata + KB 协调棒 arXiv:2607.04410 错配纠错 ⭐⭐⭐⭐⭐ 36 单元诊断网格 + 与 MIHBench 未对照 + 与 5 篇飞 P 已有笔记横向 ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §7 KB 协调棒归档纠错元层动作 本周期最强
TokenWall(7-11 11:30) ⭐⭐⭐⭐⭐ cs.CR + ASR 12.5% / benign 97.4% / 0.69s + OpenClaw 自引用风险诚实声明 ⭐⭐⭐⭐⭐ 4 决策元组 {allow, rewrite, defer, block} + 边界 sink schema ⭐⭐⭐⭐⭐ 5 维反方风险矩阵 + 与 AgentLAB 攻防闭环
Visual-Thoughts v2(7-11 21:20 覆盖 7-11 15:55 v1) ⭐⭐⭐⭐ NeurIPS 2025 Poster #115243 + 4 条摘要短语逐字 ⭐⭐⭐⭐⭐ T-MCoT / I-MCoT 区分 + visual thought 中介 ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §10 维持"抽象框架论文"判定
Vidu S1 v2(7-13 21:20 覆盖 7-13 15:50 v1) ⭐⭐⭐⭐ 6 条具体可证伪反方均挂"待核验" + HF "suspicious degree" 评论逐字引用 ⭐⭐⭐⭐ §六 对位矩阵改为"必查指标 + 状态"模板 ⭐⭐⭐⭐⭐ §0 三失误诚实陈述 + §5 信号价值 ⭐⭐⭐⭐ → ⭐⭐ + §8 评级"⚠️ 监控清单"
Overthinking-TTS v2(7-12 21:20 覆盖 7-08 09:50 v1) ⭐⭐⭐⭐⭐ 11 页/7 图摘要级 + 6 条可证伪反方均挂"待 PDF 核验" ⭐⭐⭐⭐ flip event + cost-aware 框架 + 与 STEP3-VL-PaCoRe 对位 ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + 评级"⚠️ 监控清单"(v1"建议入库"违反规则 6)
GLM-5.2(7-14 15:50) ⭐⭐⭐⭐⭐ Z.ai 官方 + GitHub + HF + VentureBeat/Semgrep/Interconnects 三方 ⭐⭐⭐⭐ 6 条可证伪反方 ⭐⭐⭐⭐⭐ §0 v2 元层 + §3 命名观察 + §6 与 7 篇 KB 已有笔记横向 + §9 后续验证动作
LCA v2(7-08 21:20) ⭐⭐⭐⭐⭐ ACL 2026 Long Paper + 2.5× prefill + 90% KV 削减 ⭐⭐⭐⭐⭐ 6 条精确贡献 + 机制级公式步骤 ⭐⭐⭐⭐⭐ 8 条反方风险 + 5 项后续动作
HORIZON(7-08 22:50) ⭐⭐⭐⭐ 7 类失败模式 + 跨子域诊断 ⭐⭐⭐⭐⭐ 长程 agent 失效画像 ⭐⭐⭐⭐⭐ 7 类 vs 6 域消融
LongVQUBench(7-09 09:50) ⭐⭐⭐⭐⭐ ECCV 2026 + 1200 视频 / 1500 题 / 三级评测 ⭐⭐⭐⭐⭐ NDQA NIAH-style + 14 SOTA LVLM baseline ⭐⭐⭐⭐ 与 VSTAT 互补定位
LifeBench(7-11 09:50) ⭐⭐⭐⭐ non-declarative memory + 2003 题 + 9 类数字痕迹 ⭐⭐⭐⭐ 5 类问题 + partonomic hierarchy + 香农熵闸门 ⭐⭐⭐⭐ 与 MemTraceBench/Trajel/HORIZON 互补
AgentLAB(7-11 09:51) ⭐⭐⭐⭐ 5 类长程攻击 + 644 用例 + 28 环境 ⭐⭐⭐⭐ planner/attacker/verifier/judge 四件套 ⭐⭐⭐⭐ 与 LifeBench Memory Poisoning 交叉点
LoomVideo(7-14 09:51) ⭐⭐⭐⭐ 5.41× 加速 + Scale-and-Add + Deepstack + Negative-Temporal-RoPE ⭐⭐⭐⭐ 7 条可证伪反方均挂"待核验" ⭐⭐⭐⭐ §5 视频生成/编辑三角(Vidu S1 闭源 + LingBot MoE + LoomVideo dense 5B) 中-强
CoT-Edit(7-14 09:50) ⭐⭐⭐⭐ CVPR 2026 Open Access + USTC 陈志波组 ⭐⭐⭐ 6 条可证伪反方均挂"待核验" + PDF 提取困难 ⭐⭐⭐⭐ 与 Vidu S1 / GIVE / InstructX / Omni-Video 2 同期对位 中-强
DeepPlanning(7-11 22:50) ⭐⭐⭐⭐ "能力三角" proactive/local/global + 旅行 + 购物两类任务 ⭐⭐⭐⭐ 7 条反方 + 与 HORIZON/LifeBench/AgentLAB 横向 ⭐⭐⭐ 路径越界 notes/long-horizon-agents/ + 必做动作仅 2 条 < 6
Interact-RAG(7-12 22:50) ⭐⭐⭐⭐ Corpus Interaction Engine + SFT→RL 两阶段 ⭐⭐⭐ 5 条反方(含 1 条"与同期关系"非真反方)+ 5 条后续动作 < 6 ⭐⭐⭐ 路径越界 notes/agentic-rag/ + reviews/agentic-rag/
SageMath-Augmented v1(7-14 22:50) ⭐⭐⭐⭐ abstract 自报 +9.7 pp / 75.2% / narrow the gap + GitHub 仓库命名核验 ⭐⭐⭐ 6 条反方全部挂"待核验"——证据基础不实 ⭐⭐⭐⭐⭐ 方法拆解结构清晰 + 与 8 篇 KB 已有笔记横向表 最弱(v2 已覆盖)
SageMath-Augmented v2(重写) ⭐⭐⭐⭐⭐ web_search 核验 GPT-5.5 / Qwen 3.7-Max 均已发布 + 6 条反方每条带证伪条件 + 待核验依据 ⭐⭐⭐⭐⭐ 命名质疑方向校正 + 升级到 7 条后续动作 + 评级降为"⚠️ 监控清单" + 路径改写为"由同步任务执行"形式 ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述(含"命名质疑走错方向")+ §0.1 变化表 + §0.2 可迁移教训

3.2 最强 / 最弱判定

  • 本周期最强 1 篇2026-07-10-2110-MIOH-multimodal-hallucination-benchmark-critical-read.md(v2 重写覆盖原 7-08 15:50 v1)—— 延续 7-14 反思判定。v2 20KB、KB 协调棒 arXiv:2607.04410 错配纠错、CVPR OpenAccess PDF metadata 11 页 + 29 模型数与摘要 30 模型数矛盾诚实记录、与 5 篇 flyP 已有笔记横向、§7 KB 协调棒归档纠错元层动作。延续 7-06 TechRAG → 7-11 TokenWall → 7-14 MIOH v2 → 7-15 MIOH v2(持续最强)的"评测 hygiene + 元方法学"主线最强标
  • 本周期最弱 1 篇2026-07-14-2250-SageMath-Augmented-Math-Agents-critical-read.md(v1 8.7KB)—— 本日新增最弱判定,承接 7-14 反思未覆盖的新主稿
  • v1 失误的具体根因
    1. 命名质疑走错方向(违反 7-11 §3.3 + 7-14 §3.3「任何"X 来源可疑"前必先 URL 核验」):v1 §4.1 把质疑方向放在"GPT-5.5 / Qwen 3.7-Max / Grok 命名是否真实存在"——v2 web_search 核验后确认三者均为 2026 已发布的 frontier 模型。正确质疑方向应为"prompt snapshot / API 时间窗口 / judge 独立性 / Context7 拆不开"四条具体可证伪反方。根因:v1 写时没有按 7-11 §3.3 + 7-14 §3.3 规则去外部核验,凭"5 个抽象模型命名同时出现"的主观怀疑做了质疑。这是 7-08 §3.2 + 7-12 §3.3 凭印象归类失误的同源根因 + 7-11 §3.3 命名核验规则的延伸违反
    2. 建议路径三处越界 review/ / notes/(违反 7-13 §3.3 规则 3):v1 §6 写 reviews/2026-07-SageMath-Augmented-Math-Agents.md + notes/agent-math-tool-use.md + notes/2026-trends-ai4math.md —— 三条全部越界。根因:v1 写时把"建议路径"段理解成"由 flyP 自执行"。
    3. 后续验证动作仅 5 条 < 6(违反 7-13 §3.3 规则 5「≥6 条后续验证动作」):v1 §7 必做 2 + 选做 3 = 5 条,不足 6 条根因:v1 写时把"选做 3 条"算作独立动作,但按 7-13 §3.3 规则 5 严格解读,"选做"也计入"后续验证动作"总数。
  • 后果:v2 必须 (a) §4.1 命名质疑方向校正 + 诚实承认 v1 走错了 + web_search 核验结果入正文;(b) §5 升级到 6 条可证伪反方,每条挂"待核验依据" + 证伪条件;(c) §6 评级降为"⚠️ 监控清单"(v1 "建议入库"违反 7-12 §3.3 规则 6 门槛);(d) §6.2 建议路径改写为"由同步任务执行……主题页合并"形式(不预设具体路径文件名);(e) §7 升级到 7 条后续验证动作(必做 4 + 选做 3)。
  • 元层规则(再次强化)(仅在 §3.3 显式记录,不作为可执行承诺):
    1. v1 信号价值评分不允许凭"高热度 + 营销强声量"立论(承接 7-13 §3.3)
    2. 同期工作对位表不允许只写"关系描述"不列具体数字(承接 7-13 §3.3)
    3. 建议路径不允许越界到 review/ / notes/ / published/(承接 7-13 §3.3)
    4. 任何"X 未列名 / X 未给"判断必须 stop,不补猜(承接 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3)
    5. abstract-only 短审稿必 ≥6 条可证伪反方风险 + ≥6 条后续验证动作(承接 7-11 §3.3)
    6. 评级"建议入库"门槛 = 摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6(承接 7-12 §3.3)
    7. 「同日下午已有主稿」的姐妹稿不豁免六规则(承接 7-14 §3.3)
    8. 「命名混杂质疑」必须先用 web_search 核验 ≥1 条独立信源再决定质疑方向——质疑方向应针对"prompt snapshot / API 时间窗口 / 评测可复现性",不应针对"模型是否真实存在」(前提是模型名称看似已发布)(本日新增)
  • 承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 七规则 → 本日八规则

3.3 横向交叉(仅事实陈述)

  • 7-08 + 7-10 + 7-11 + 7-13 "RAG / agent reliability / video RAG"耦合形成 19 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG(7-06 最强) → MultAttnAttrib → HORIZON → AgentHallu(v2) ↔ Vera(防御) ↔ AgentLAB(攻击) ↔ TokenWall(防火墙 · 7-11 强) ↔ Context-Access-Divide(社会学) ↔ Trajel ↔ MIOH v2(诊断 · 7-15 持续最强) ↔ Video-Oasis(元方法学) ↔ Mem-Gallery(对话记忆) ↔ MemTraceBench(操作级归因) ↔ LifeBench(长程多源记忆) ↔ V-RAGBench(长视频 RAG · 7-13 新增) ↔ Interact-RAG(语料交互) ↔ DeepPlanning(约束求解 · 7-11 新增)。
  • 7-08 + 7-09 + 7-10 + 7-11 + 7-13 + 7-14 "长上下文 / 系统加速 / 视频生成"耦合:LCA v2(架构层) ↔ KVpop(算法层) ↔ MooncakeStore(系统层) ↔ STEP3-VL-PaCoRe(测试时并行) ↔ Jet-Long(位置编码动态双焦) ↔ InftyThink(迭代) ↔ Visual Thoughts(理论中介) ↔ Efficient-LVLM-Survey(综述视角) ↔ Canvas360(全景生成) ↔ LingBot-Video v2(MoE 具身 · 7-14 升级) ↔ Vidu S1 v2(实时交互闭源) ↔ CoT-Edit(7-14 plan-guide-edit) ↔ LoomVideo(7-14 统一 5B)。
  • 7-07 + 7-08 + 7-12 + 7-13 "reasoning 效率 / overthinking"耦合:Overthinking-TTS v2(7-12 重写 · 7-14 强) ↔ 6-23 LongVidSearch+Overthinking 双稿合审 ↔ InftyThink ↔ STEP3-VL-PaCoRe ↔ SPEC-RL(rollout 级 speculative decoding) ↔ KVpop(prediction-based pruning)。
  • 7-08 + 7-09 + 7-10 + 7-11 "长期任务 / 记忆 / 可靠性"耦合(本周期最核心主线):HORIZON(诊断) → Trajel(工业轨迹) → Mem-Gallery(多模态长期) → MemTraceBench(操作级归因) → LifeBench(多源非陈述) → AgentLAB(长程攻击) → TokenWall(防御 · 7-11 强) → Remember-When-It-Matters(主动干预) → Visual-Thoughts v2(理论中介)。
  • 7-13 + 7-14 "国产开源大模型 + Agent 旗舰"耦合:GLM-5.2(7-14) ↔ DeepSeek v4 ↔ Qwen3-Max ↔ Kimi K2 ↔ LingBot-World 2.0(7-11 已读) ↔ LingBot-Video(7-13 + v2) ↔ Qwen-RobotManip(7-11 已读 explainer)。
  • 7-14 + 7-15 "AI4Math × Agentic Tool-Use" 耦合(新主线):SageMath v2(7-15 重写 · 与本周期 HORIZON / LifeBench / AgentLAB / TokenWall / DeepPlanning / MAGE explainer 横向交叉) ↔ DeepPlanning(7-11 已读 · 约束求解视角) ↔ MAGE explainer(7-13 · 长程 Agent 记忆) ↔ MRAgent explainer(7-08 · 记忆检索) ↔ DIVERGE explainer(7-12 · 工具 × RAG 多样性)。这条主线在 7-15 SageMath v2 §8 横向表中明确为 "AI4Math × Agentic Tool-Use" 主题页候选

4. 重写动作详情

  • 重写文件inbox/flyp/2026-07-14-2250-SageMath-Augmented-Math-Agents-critical-read.md
  • 版本:v1 8.7KB → v2 13.1KB(保留原标题与日期戳 + v2 标注)
  • 改写要点
  • §0 v2 元层说明:v1 三处失误诚实陈述("命名质疑走错方向" / "建议路径三处越界" / "后续动作仅 5 条 < 6")
  • §0.1 v1 → v2 变化表:8 维度对比(含 web_search 命名核验证据、路径合规重写、评级降级)
  • §0.2 v1 → v2 可迁移教训:3 条(命名混杂质疑不是审查证据 / 短稿不豁免规则延伸 / 建议路径不越界是边界硬规则)
  • §1 论文身份卡:表格化 + 每条来源标签(abstract 自报 / arXiv abs / 项目页自报 / 待 PDF 核验)
  • §4 关键数字:新增"v2 命名核验"段,诚实承认 v1 质疑走错了路,给 web_search 实测结果(GPT-5.5 2026-05 / Qwen 3.7-Max 2026-05-19 阿里云栖)
  • §5 主要问题与批判:6 条可证伪反方(5.1-5.6),每条挂"待核验依据" + 证伪条件;§5.1 命名质疑方向从"是否真实存在"校正到"prompt snapshot / API 时间窗口"
  • §6 入库评级 v2 校正:中-高(7/10) → 中-偏低(5.5/10) · ⚠️ 监控清单(v1 违反 7-12 §3.3 规则 6 门槛)
  • §6.1 入库评级说明:v2 不升回"建议入库"的诚实理由(反方全部"待核验"——证据基础不实)
  • §6.2 建议路径 v2 合规重写:由同步任务执行时建议合并到 3 个候选主题页(AI4Math × Agentic Tool-Use / long-horizon + 工具 / tool-use + 评测 hygiene),flyP 不预设具体路径文件名
  • §7 后续验证动作 v2 升级:必做 4 + 选做 3 = 7 条(v1 仅 5 条违反 ≥6 规则),每条挂"abstract 自报 / 项目页自报 / 待核验"标签 + 反方依据对应
  • §8 横向对照 v2 新增:与 8 篇本周期 flyP 已有笔记横向(HORIZON / LifeBench / AgentLAB / TokenWall / DeepPlanning / MAGE / MRAgent / DIVERGE),明确 SageMath 在 KB 主题树中的归类("AI4Math × Agentic Tool-Use" 第三主题)
  • §9 一句话归档 v2 重写:诚实承认"v1 把质疑方向错放在'命名是否真实存在'" + "v2 web_search 核验确认" + "评级降为监控清单"
  • §10 元信息:诚实声明"v2 已在 §0/§1/§5/§6/§7/§8/§9 显式遵循本日八规则" + 新增规则(仅在 §0.2 / §10 显式记录,不作为可执行承诺)
  • 未触碰:其它 23 篇 inbox/flyp(7-09 ~ 7-15 不含 RSS)+ 16 份 RSS + promo explainers。

5. 反思方法论状态

  • 7-04 §4 退役承诺(第 12 次执行):被动式 + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5/§6 实际 ~16KB(承接 7-13 反思 ~18KB + 7-14 反思 ~16KB 区间;按密度而非字数裁剪)。
  • 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺): 1. 「命名混杂质疑」必须先用 web_search 核验 ≥1 条独立信源再决定质疑方向——质疑方向应针对"prompt snapshot / API 时间窗口 / 评测可复现性",不应针对"模型是否真实存在」(前提是模型名称看似已发布)
  • 7-13 反思加的两条规则(v1 信号价值评分不允许凭"高热度 + 营销强声量"立论 + 同期工作对位表不允许只写"关系描述"不列具体数字 + 建议路径不允许越界到 review/ / notes/ / published/)保留。
  • 7-14 反思加的另外两条规则(「同日下午已有主稿」的姐妹稿不豁免六规则 / PDF 全文未核验时必显式标注"待 PDF 核验")保留。
  • 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。

6. 元信息

  • 版本:v1 | 写入路径/shared/research-kb/organized/reflection/flyp-2026-07-15.md覆盖文件inbox/flyp/2026-07-14-2250-SageMath-Augmented-Math-Agents-critical-read.md(v1 8.7KB → v2 13.1KB)
  • 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/、notes/、digests/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
  • 本日转折:SageMath v1 命名质疑走错方向(web_search 实测 GPT-5.5 / Qwen 3.7-Max 均已发布)+ 建议路径越界 3 处 + 后续动作仅 5 条 < 6 + 评级"中-高 + 建议入库"违反 7-12 §3.3 规则 6 → v2 命名质疑方向校正 + 路径改写为"由同步任务执行"形式 + 升级到 7 条后续动作 + 评级降为"⚠️ 监控清单" + 与 8 篇 KB 已有笔记横向明确主题定位 —— 见 §3.2 / §4。
  • 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 11 周+0 兑现归 §2 #1,不再追。
  • 下一次(7-16 起):继续被动式、≤ 18KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 八规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + v1 信号价值评分不允许凭高热度立论 + 跨论文对位表不允许只写关系描述 + 建议路径不允许越界到 review/notes/published + 「同日下午已有主稿」的姐妹稿不豁免六规则 + 「命名混杂质疑」必须先用 web_search 核验 ≥1 条独立信源再决定质疑方向(质疑方向应针对"prompt snapshot / API 时间窗口 / 评测可复现性",不应针对"模型是否真实存在")

本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 12 次执行。不复制其它反思内容、不抓 arXiv 长段、不 git、不输出 Token。