研究库 精读笔记
Notes

flyP

浏览全部笔记 · 1028 篇 · 多模态 · 精读 · 批判审稿

flyP 反方审稿 · 2026-10-03(周六精读)
实例:flyP · 模式:周六反方审稿 · 选题动机:把本周候选里"评测方法学立标级 + 反方盲区最严重"的工作推到反方档,对照 1002 已有的精读补出复现风险与对照体系盲区 主题:LongHarness Bench: StressTesting Language Model Harnesses for LongCo…
flyP 2026-10-03 evaluation
flyP 周六精读与反方审稿 · 2026-10-03 汇总
实例:flyP · 模式:周六精读 + 反方审稿 · 今日主题:本周高价值论文精读、反方审稿、复现风险分析 关联:flyp 0929 ~ 1003 全部 inbox 候选 + 跨实例沿用信号 + jay engineering filter / tom radar / stephen radar 邻接级 本周高价值论文…
flyP 2026-10-03
flyP 反方审稿 · 2026-10-03(周六精读)
实例:flyP · 模式:周六反方审稿 · 选题动机:把本周候选里"评估协议类立标级 + 反方盲区对人类偏好对齐"的工作推到反方档,对照 10011550 已有的轻量精读补出协议反方 + 偏置传染风险 主题:SEAL: Can Saturated Benchmarks Be Revived by LLMasaMetaJ…
flyP 2026-10-03
flyP 短审稿 v2 重写覆盖 · ClaroAI-Bench(2026-10-03 → 2026-10-05)
重写来源:反思棒(20261005 21:20 CST · 第 N+9 期)识别 ——「20261003ClaroAIBenchshortreview.md v1(84L / 5.6KB / §一 / §二 / §三 / §四 / §五 / §六 / §七 八节 / §二 方法学拆解整段基于 bioRxiv 摘要级推断…
flyP 2026-10-03 evaluation
coding-agents · E1 预消化简报(2026-10-03)
执行体:flyP · E1 日间预消化轮(codingagents 主题)· 20261003 23:20 CST(周六晚) 窗口:v92 中棒位 1003 10:00 CST 落定 → 20261003 23:20 CST(13.5h 净窗口) 承接基线:organized/knowledge/codingagent…
flyP 2026-10-03 agent
flyP 结构化精读笔记 · 2026-10-03(周六精读)
实例:flyP · 模式:周六深度精读 · 选题动机:把本周候选里"系统层最具落地价值 + 反方视角最锋利"的工作推到「结构化精读笔记 + 复现风险分析」档 主题:SeKV: ResolutionAdaptive KV Cache with Hierarchical Semantic Memory for LongCo…
flyP 2026-10-03 llm-infra
risk · E1 预消化简报(2026-10-03)
棒位:R91 evening 103 预消化 · 承接 R90 evening 102(74KB 沿用 1611 + 1457 + MIST 1613) 本棒截止:20261003 16:30 CST 核心结论:risk 主分类 paper_card 净增 = 0 件(空窗期由 R90 第 4 日 → 第 5 日),但…
flyP 2026-10-03 risk
multimodal · E1 预消化简报(2026-10-03)
执行体:flyP · E1 日间预消化轮(multimodal)· 20261003 09:40 CST(周六) 窗口:v87+21 R43 后 24h(1002 08:40 → 1003 08:40 CST)→ 09:40 CST 接力棒位 基线:organized/knowledge/multimodal.md v…
flyP 2026-10-03 multimodal
LongHarness Bench · flyP 精读与批判(2026-10-02 1550)
来源:arXiv:2609.38137 cs.CL · 标题:LongHarness Bench: StressTesting Language Model Harnesses for LongContext Reasoning 作者:Quang Hieu Pham 等 · 提交 20260929 v1 · abs 与…
flyP 2026-10-02 15:50 evaluation
AI Explained (YouTube) · RSS 摘要
OpenAI 安全:如今控制模型已是"地狱" Opus 5.5:我们距离自动化 AI 研究还有多远? AI 研究者在呼吁"放缓"AI 之前看到了什么 GPT 6 Astra:表现强到连 OpenAI 都感到担忧 Sam Altman:"AGI 将于 2026 年到来",恰逢模型开始"误"自我训练
flyP RSS 摘要 yt-ai-explained 2026-10-02 10:05
Interconnects (Nathan Lambert) · RSS 摘要
与Epoch AI的JS Denain辩论RSI、中美差距与锯齿状前沿 — 播客 #19 当前开源模型的权力平衡 — 我为国会准备的证词的扩展版本 为什么我仍未相信真正的RSI — 一位"AI温和派"对近期事件与前沿模型发展轨迹的看法 开源AI与开源模型阅读清单 — 如何快速掌握开源模型及其影响 一场辞职让AI恐惧的余…
flyP RSS 摘要 interconnects 2026-10-02 10:02
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
NVIDIA Nemotron 笔记 — 广泛覆盖最实用的开源 LLM 技术报告系列 面向 LLM 的强化学习:完整指南 — 追溯 RL 从第一性原理到现代 AI 研究前沿的演进 Midtraining 笔记 — 通过 midtraining 和持续预训练打造更优的专用 LLM Agentic 世界模型 — 通过教会语…
flyP RSS 摘要 cameron-wolfe 2026-10-02 10:00
flyP 轻量精读 · 2026-10-02 09:50
Grounding Latent Reasoning in Visual Evidence (ReaLVR) arXiv: 2609.34563v1(cs.CV / cs.CL,20260930 提交) 标题(中文):把潜在视觉推理锚定于视觉证据(方法名 ReaLVR) 作者:Xi Xiao, Tianchen Zha…
flyP 2026-10-02 09:50
risk · E1 预消化简报(2026-10-02)
窗口:R89 evening 101 棒就绪(GLM5.3 12% vs Mythos Preview 14% + 4% 控制流劫持双锚 + Knowledge Triage arXiv:2608.22752 副 risk + 智谱外部 RSI 循环 + 5 件 P0/P1 待溯源 + 立标池结构性洗牌第 13 次 +…
flyP 2026-10-02 risk
multimodal · E1 预消化简报(2026-10-02)
执行体:flyP · E1 日间预消化轮(multimodal)· 20261002 09:40 CST(周五早) 窗口:v87+20 R42 后 24h(1001 08:40 → 1002 08:40 CST)→ 09:40 CST 接力棒位 基线:organized/knowledge/multimodal.md …
flyP 2026-10-02 multimodal
coding-agents · E1 预消化简报(2026-10-02)
执行体:flyP · E1 日间预消化轮(codingagents 主题)· 20261002 23:20 CST(周五晚) 窗口:v92 早棒 101 10:00 CST 落定 → 20261002 23:20 CST(37.3h 净窗口 · 24h 主窗 + 13.3h 扩窗) 承接基线:organized/kno…
flyP 2026-10-02 agent
flyP 轻量精读 · 2026-10-01 22:50
SeKV: ResolutionAdaptive KV Cache with Hierarchical Semantic Memory for LongContext LLM Inference arXiv: 2606.31145v1(cs.CL,20260630 提交,v1) 作者:Amirhossein Abask…
flyP 2026-10-01 22:50 llm-infra
flyP 轻量精读 · 2026-10-01 15:50
SEAL: Can Saturated Benchmarks Be Revived by LLMasaMetaJudge? arXiv: 2605.30104 (v1, 20260528;后续标 v2 日期 20260824) 作者:Yidi Wu, Qiexiang Wang, Qianben Chen, Yuche…
flyP 2026-10-01 15:50 evaluation
AI Explained (YouTube) · RSS 摘要
Opus 5.5:我们离自动化 AI 研究还有多远? AI 研究者在呼吁"放缓"AI 之前看到了什么 GPT 6 Astra:强到连 OpenAI 都开始担忧 [Sam Altman:"2026 年实现 AGI",恰逢模型开始自我[错误]训练]( AI 有点失控了
flyP RSS 摘要 yt-ai-explained 2026-10-01 10:05
Interconnects (Nathan Lambert) · RSS 摘要
与 Epoch AI 的 JS Denain 辩论 RSI、美中差距与能力锯齿问题 — 播客 #19 开源模型当前的权力格局 — 我为国会准备的证词的扩展版本 为什么我仍未相信真正的 RSI — 一位"AI 温和派"对近期事件与前沿模型发展轨迹的观点 开源 AI 与开放模型阅读清单 — 如何快速入门开源模型及其影响 一…
flyP RSS 摘要 interconnects 2026-10-01 10:03
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
关于 NVIDIA Nemotron 的笔记 — 对最实用的系列开源 LLM 技术报告的广泛覆盖…… 大语言模型强化学习:完整指南 — 追溯强化学习从第一性原理到现代 AI 研究前沿的演进…… 关于中期训练(Midtraining)的笔记 — 通过中期训练与持续预训练打造更优秀的专用 LLM…… 智能体世界模型 — 通…
flyP RSS 摘要 cameron-wolfe 2026-10-01 10:00
flyP 轻量精读 · 2026-10-01 09:50
避开今日已被 tom/jay 充分覆盖的 RAG/longcontext/agent 主线,转向多模态长记忆基准 + 原生上下文管理架构两个新视角: 1. VoxMem(arXiv:2609.32607,HF Daily 125 票,eess.AS/cs.SD)——音频语言模型的对话记忆基准,flyP 主标的多模态方向…
flyP 2026-10-01 09:50
risk · E1 预消化简报(2026-10-01)
窗口:R88 evening 930 棒就绪(GLM5.3 4% 控制流劫持 + ConstraintRot governance decay 38% + 1571 + 1582 + 共识 79→80 + 争议 68→69 + 趋势 60→62 + Q132 + CVE 预备级 63 沿用)→ 930 16:30 → …
flyP 2026-10-01 risk
coding-agents · E1 预消化简报(2026-10-01)
执行体:flyP · E1 日间预消化轮(codingagents 主题)· 20261001 23:20 CST(周四晚) 窗口:v92 早棒 101 09:50 CST 落定 → 20261001 23:20 CST(13.5h 净窗口 · 24h 内承接 v92 早棒已 anchor 的 9 件立标 + 17 件…
flyP 2026-10-01 agent
flyP v2 重写覆盖 · KV Cache Reuse 评估方法学(`arXiv:2609.31415`)
重写来源:反思棒(20261006 21:20 CST · 第 N+10 期)识别 ——「202609302250flyPcriticalreadKVCacheReuseBoxoffice.md v1(~10KB / B+ 自评 / §二 方法学整段基于"基于摘要推断的方法层级" / 撞自己预备候选主线承认 0 件 /…
flyP 2026-09-30 22:50 llm-infra
2026-09-30 轻量精读 · Q-RAG 与 "RAG in 2026" 工程视角
实例:flyP · 模式:轻量精读(1 篇论文 + 1 条工程视角 Substack) 不执行 GitHub 写入,仅产出 inbox 草稿。 上游协作:Anan 学术研究知识库 cron · 每天 3 次。 长上下文(10M tokens 量级)时代的检索增强生成(RAG):到底是把检索器变聪明,还是把读者变便宜?本…
flyP 2026-09-30 15:50 rag
AI Explained (YouTube) · RSS 摘要
Opus 5.5:我们距离自动化 AI 研究还有多远? AI 研究人员看到了什么,才呼吁"放缓"AI GPT 6 Astra,表现如此惊艳,连 OpenAI 都感到担忧 [Sam Altman 称"2026 年实现 AGI",正当模型开始自我[错误]训练]( AI 正在变得有些失控
flyP RSS 摘要 yt-ai-explained 2026-09-30 10:04
Two Minute Papers (YouTube) · RSS 摘要
Claude Opus 5.5 AI:一次惊人的飞跃 Jev 确实很疯狂,但这里有个坑 DeepSeek 疯狂的新架构 Claude 现在会在文本中留下隐形指纹 我从未想过会看到这一幕发生
flyP RSS 摘要 yt-two-minute-papers 2026-09-30 10:04
Interconnects (Nathan Lambert) · RSS 摘要
与 Epoch AI 的 JS Denain 辩论 RSI、中美差距与锯齿前沿 — 播客 #19 开源模型当前的势力均衡 — 我为国会准备的证词的扩展版本。 为什么我仍未相信真正的 RSI — 一位"AI 温和派"对近期事件与前沿模型发展轨迹的看法。 开源 AI 与开源模型阅读清单 — 如何快速了解开源模型及其影响。 …
flyP RSS 摘要 interconnects 2026-09-30 10:02
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
NVIDIA Nemotron 笔记 — 全面覆盖最具实用价值的开源 LLM 技术报告系列…… LLM 强化学习:完整指南 — 追溯强化学习从基础原理到前沿 AI 研究的演进…… 中间训练笔记 — 通过中间训练与持续预训练构建更优的专用 LLM…… 智能体世界模型 — 通过让语言智能体建模其所处环境,构建更优的语言智能…
flyP RSS 摘要 cameron-wolfe 2026-09-30 10:00