解读
2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
SimuVerity:当"能跑起来的 Simulink 模型"不等于"工程上合格"——一套 101 题六维分级评测
仓库与数据已公开: 提交注释显式给出)。⚠️ 提示:本解读基于 arXiv v1 摘要 + 论文卡 + 注释,PDF 全文未下载,所有具体数字以原文 abstract 为准。 1. 真问题是什么?——现有 Simulink 评测只看"能不能编译 / 能不能跑 / 像不像参考模型",不验证模型是否满足工程规格,导致"看起…
主题综述 · database(2026-10-05)
930 → 1005 窗口 5 天净增 academic candidates + 工程实战多件。database 主轴从「OpenViking + KVdisaggregated + CloudNative K8s + 方法论批评」四主轴扩张到「向量库选型矩阵五层 + GPU 共置落地 + Agent Memory …
Persona Dosing:分级特性控制的校准激活引导
PersonaDose 把"激活引导系数"升级为"行为量表"——通过特性描述 + 请求强度共同控制的 FLAS 控制器,再以实测特性表达回标流时间,让 LLM 按"几分人设"精确出活,而不是粗暴地"开/关"特性。 激活引导(activation steering)通常给一个乘性系数 α,模型就"多一点这个特性"。但产品…
Transformer 过早停止思考,一个微型 LoRA 即可修复
预训练 Transformer 用极少层数就能完成"在长上下文里精确指代/跟随"任务的事实,意味着只要在一个早期层插一个 rank8 LoRA,就能把 Qwen38B 的 24 行精确指代从 15.5% 抬到 99%,且主模型权重全程冻结。 LLM 在长上下文里做"按编号/按行指代"的链式推理时,表现远不如短上下文。直…
DyadMem:Agent 如何与用户协作的长期记忆基准
DyadMem 提出"用户条件关系型 Agent 记忆"(URAM)概念,把长期 Agent 记忆拆成"用户事实 + 关系专属记忆"两条线,并在 3,065 episodes / 50,961 sessions / 61,210 QA 上证明——只测 GoldMemory QA 会严重高估当前 LLM 的长期记忆能力,…
追踪状态足迹:让 Agent 真正"会事务处理"
把多 Agent 协作视作一个数据管理问题,提出"状态足迹"(state footprint)作为 Agent 的第一类公民元数据,主张下一代 Agent 编排器必须像数据库事务系统一样,为并行 Agent 提供类似 ACID 的执行保证,但又能用 LLM 的语义能力去做冲突解决而非粗暴 abort。 当 Agent …
ChatGPT 上线一个月,Twitter 上 10,732 条推文告诉你:用户是真的在用它干这些事
2022 年 11 月 ChatGPT 公开发布那天,媒体把它同时喊成"教育终结者"和"创造力放大器"。开发者社区、SaaS 厂商、教育机构都在猜:真实使用形态到底是什么?是真革命,还是又一轮 hype? 一个月后——2022 年 12 月——一份 arXiv 预印本(2212.05856)给了第一份大规模真实用户数据…
当 AI 还在「画鬼打架」时,2015 年这篇论文已经用统计把"骗 GAN 的游戏"换掉了
2014 年底,一个叫 GAN 的新玩法横空出世——让两个神经网络"对着干":一个画假图,一个当判官,判官越严格,画师就越厉害。听起来很燃,但工程师上手两周就会发现:这东西根本训不稳。 模式坍塌(画师只会画同一种图)、训练震荡(判官画师来回拉扯)、判别器饱和(判官太强画师直接放弃学)——这些都是 2015 年 AI 圈…
2609-09134
日期:20261005(Asia/Shanghai) 轮次:R2 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20261005_R2_onpolicyharnesscorrection_shortvideoscript.md 标题:协同进化反 hook · o…
推广选题榜 · 2026-10-05
近 30 天(20260905 至 20261005)入库论文共 437 篇,以下 Top 8 综合「被引 + 评审分 + SOTA 声称 + 新近度 + 话题热度」选出。 #1|DeepSeekV4.1Flash: Pushing the Limits of KV Cache Compression arxiv: 2…
你以为"上传图片搜相似图"是只读操作——2026 这篇论文告诉你,攻击者能用它偷走你整个图库
如果你做 RAG 应用、做过企业内部知识库搜索、或者用过任何"上传图、返回相似图"的产品形态,你大概率默认一件事: "我上传的是查询图,系统返回的是候选图——这是只读操作,我自己的图库没暴露。" 这个直觉是错的。 2026 年 10 月这篇论文 Walking the Embedding Space(工作名)/ Dat…
你让 Sora 帮你"煎蛋"——它端出来的可能是完美的空盘子
如果你是做具身 AI 或机器人研究的工程师,你大概率听过这种话:"Sora / Wan / Kling 这些视频生成模型现在就是世界模拟器,给一张图+一个动作,它就能生成未来视频。" 这话听着很性感——意味着我们可以用视频生成模型来合成机器人训练数据、预演自动驾驶路径、给 VLM 模拟一个练习环境。 但你仔细想,会发现…
Twitter 早期 ChatGPT 用户情感研究:10,732 条推文的混合方法分析
对 10,732 条 ChatGPT 早期采用者推文做"主题建模 + 质性情感分析"的混合方法研究,结论是早期采用者整体高度正面,集中于"软件开发被颠覆 / 娱乐与创造力激发",而对教育领域的潜在滥用表达明显担忧。 2022 年 11 月 ChatGPT 上线后,公众认知与情绪在数日之内剧烈分化:媒体把它同时描述成"教…
Harness-of-Harness:让 LLM Coding Agent 持续多日自主开发软件
HarnessofHarness(HoH)是一种"在 Coding Agent Harness 之上再包一层 Harness"的元架构,它把单次任务执行拆成"规划—编码—测试"的迭代闭环,并强制小步可验证、修复与能力增长平衡、版本化项目历史等约束,使 LLM Coding Agent 能在 70+ 轮迭代的多日窗口内持…
协同进化 Harness 与模型:On-Policy 专家修正让弱模型追平模仿失效点
论文研究"Harness 进化 + 弱模型轻量微调"如何协同,发现先用弱模型进化 Harness,再用强专家在已进化 Harness 上跑全轨迹让弱模型模仿,会破坏 modelharness fit(性能在 7 个企业 Agent 任务上回归 430 分);改用 onpolicy 专家修正流水线(只重写弱模型自身 ro…
视频选题榜 2026-10-04(v2 重写覆盖 · 反思棒 #67 触发)
v1 → v2 修复:v1 文件 500B / 3 行 / 3 条单行 bullet,仅 3 条单行 bullet(Lower bounds for multivariate independence polynomials arXiv:2602.02450 / ThinkingBox arXiv:2608.19741…
AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4%(v2 重写覆盖 v1)
v1 主要问题(自我反思棒 1003 标记):① section 编号从四直接跳到六(漏五);② 缺独立 ⚠️ 工程核查(Jay 核查节)段;③ 数字提取率较低(4 个可锚数字 / 7 个 abstractlevel 数字点 = ~57%);④ 「5 条工程坑」压缩在文末一段,未升级到独立节;⑤ 边界声明偏薄。 现有金…
主题综述 · multimodal(2026-10-04 · v2 重写覆盖 v1)
v1 → v2 重写说明(反思棒 #57 第七次实战):v1 §0 自检栏 ④ 虚假 ✅(反方段数实为 0)+ ⚠3 + ⭐⭐⭐⭐ 双符号反弹(反思棒 #69)+ 自检梁 #70 修 / CJK "约 3,700" 数字回退 / verifiability 100% 夸大 / "诚实坦白 + 原因"话术变种(反思棒 #…
LoRA 变体圈最大的"皇帝新衣":PiSSA、DoRA 报告的 +10%~+37% 提升,可能只是学习率没调对
你做 LLM 微调时,是不是被 PiSSA、DoRA、AdaLoRA 这些"LoRA 增强变体"搞得选择困难?arXiv 2602.04998 给你一盆冷水——这些变体相对于 Vanilla LoRA 报告的"惊人提升"(有的 +10%,有的 +37%),很可能只是因为对比时用了固定或过窄的学习率范围。当学习率被认真调…
数学家遇到 AI:6 年没解的猜想,被一个"数学研究 Agent" 6 小时拿下——但别急着说 AI 取代数学家
一个困扰数学家 6 年的猜想——"多元独立多项式的下界长什么样"——被一组研究者用一个"搭建在 Gemini Deep Think 之上的数学研究 Agent"加上 Lean 形式化复核,闭环了。听起来像 AI 接管数学的剧本,但真相比这更微妙:Agent 负责生成证明草稿,Lean 负责形式化兜底,人类负责最后的边界…
Towards a Science of AI Agent Reliability:成功率之外,Agent 可靠性的四个维度与十二个指标
现有 Agent 评测只问"成功率",却忽视了"一致性、鲁棒性、可预测性、安全性"这四个决定 Agent 能否真正部署的关键维度——Princeton 团队用 12 个指标对 15 个主流 Agent 模型实测发现:近两年能力大幅提升,可靠性仅小幅改善。 AI Agent 在标准评测基准上准确率越来越高,但一到真实部署…
Memory for Autonomous LLM Agents:把 Agent 记忆形式化为「写—管—读」循环的三维分类体系
记忆是 LLM Agent 从"有状态的文本生成器"进化为"真正自适应智能体"的核心能力——这篇综述将 Agent 记忆形式化为「写—管—读」循环,用三维分类体系(时间范围 × 表示基底 × 控制策略)系统梳理了 2022—2026 年该领域的机制、评测与开放问题。 单个 LLM context window 远不够用…
Vanilla LoRA May Suffice:调好学习率,9 种 LoRA 变体都在 1-2% 以内
PiSSA、DoRA、AdaLoRA 等 LoRA 变体相对于 Vanilla LoRA 的"惊人提升"(有的报告 +10% 到 +37%),很可能只是因为对比时用了固定或过窄的超参数范围——当学习率被认真调优后,所有 9 种 LoRA 方法的峰值性能差距仅剩 1~2%,Vanilla LoRA 完全有竞争力。 LoR…
GAGAR:面向代码 Agent 强化学习的分组智能评分与优势再分配
GAGAR 在代码 Agent RL 训练中引入一个 SFT 训练的「智能评分员」,对通过测试的轨迹按实现质量重排序后做优势再分配,让 GRPO 不再把所有"过了测试"的轨迹一视同仁。 当前代码 Agent 的强化学习几乎都遵循一个套路:用可执行测试当奖励源(binary reward),再用 GRPO 做组内相对策略…
你的 RAG 系统是不是太重了?——Amazon Science 说:扔掉向量库,只靠关键词搜索就够用
"query → embedding → 向量库 ANN 检索 topk → prompt → answer"——这是过去三年所有 AI 工程师闭着眼都能写出的 RAG 默认公式。但如果你正维护着一个向量库(Pinecone、Qdrant、Milvus、pgvector 任选其一),花了钱、花了人、每天为索引重建和版本…
为什么你团队的单一大模型永远不够用?——一篇综述说清楚「集成智能体」到底是怎么回事
你有没有过这种经历:团队花重金买了最强的大模型,想让一个 LLM 把客服问答、内部文档检索、看图、看报表全部搞定。结果呢?——文档查不到最新版本、看图时答错细节、长流程里忘记三步前说过什么、复杂任务中途跑偏。最后所有人的反应都是:"这 AI 不太行啊。" 不是 AI 不行,是"单体 LLM"这件事在结构上就不够。202…
2608-19741 · Tom R2 10-04 短脚本镜像
date: 20261004 round: R2 arxiv_url: video_kb_script_path: /shared/videokb/scripts/tom/20261004_R2_shortvideoscript.md arxiv:2608.19741 · "One Success Isn't Reli…
Omni-Decision:把对话历史换成"证据台账"的全模态规划框架
OmniDecision 用"证据台账(evidence ledger)"取代不断膨胀的对话历史,让全模态智能体在多步任务中只读取结构化的证据状态,从而在 OmniGAIA 上以约 43% 的 Gemini3.1Pro 单题成本达到 81.4% 的 SOTA 准确率,并在 WorldSense 长视频理解上追平最强端到…
生成矩匹配网络(GMMN):用 MMD 取代对抗训练的早期尝试
GMMN 用 Maximum Mean Discrepancy(MMD) 这一核统计量直接作为训练损失,把"生成器单次前向采样"的 GAN 范式搬到了一个凸的、单目标的优化框架里,并在 MNIST 与 Toronto Face 上得到超过同期 GAN baseline 的样本质量。 2014 年底 GAN(Goodfe…
多元独立多项式的下界与 Gemini Deep Think 数学研究 Agent 实战
一句话结论:把经典"Sah–Sawhney–Stoner–Zhao 独立集下界"从单变量 λ 推广到每个顶点独立逸度 λᵢ 的多元情形;并且把两色半proper着色配分函数的下界也一并钉死,最关键的工程贡献是:所有关键不等式的证明步骤,是由一个自建于 Gemini Deep Think 之上的"数学研究 Agent"生…