解读
1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
On-Policy Distillation 三件事:探索催化剂、两大病态、两种轻量调控
本文对 LLM 后训练中流行的 OnPolicy Distillation(OPD) 做系统化拆解: OnPolicy Distillation(让 LLM 学生从自己采样出的轨迹上、用教师模型做 token 级指导)是 LLM 后训练常用范式,但它有三个未解之谜: 1. 角色模糊:OPD 到底在做什么?它真在「教」学…
从像素到状态:把交互式世界模型重新思考为游戏引擎
本文主张把「交互式世界模型」从「像素级视频预测器」重新定位为「游戏引擎式的 action–state–observation 循环」,沿四个维度(玩家动作控制、状态动态、状态观测持久性、实时交互生成)系统梳理现有方法的能力与 tradeoff,并配套发布一个针对《Black Myth: Wukong》的 90+ 小时可…
AffectFlow-DINO:基于条件 Rectified Flow 的不确定性感知多任务情感估计
AffectFlowDINO 在标准 DINOv3 视觉 backbone 上嫁接条件 Rectified Flow 生成头,以建模真实场景面部情感的固有模糊性,在第 11 届 ABAW 挑战赛中以 P_MTL=1.177 大幅超越官方基线 0.45,且通过后验阈值校准将稀有类别 Fear 的 F1 从 3.8% 提升…
Earthquaker-AI:面向小学地震教育的 RAG 框架与评分量规评估体系
EarthquakerAI 将基于 RAG 的对话式 AI 助手与 Lego WeDo2 教育机器人相融合,构建了一套面向小学全学段的渐进式地震安全教育框架,通过分年级评分量规(rubric)实现从选择题到开放表达的差异化评估,实验显示其具有高 groundedness、低 hallucination 率的实用可靠性。…
UniVR:在视觉空间中思考——统一视觉推理的强化学习范式与大规模评测基准
UniVR 首次提出从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划,引入 VRGRPO(全局+步级双层奖励)强化学习范式,并构建了涵盖 16 个数据源的 VRX 综合评测基准,在该基准上较基线提升达 25%,且学到的视觉推理能力可跨模态迁移。 当前 VLMs(VisionLanguage Models)在复…
自我在空间中:面向 UAV 具身智能的自我意识与空间认知基准
提出 SISBench,一个面向 UAV 具身智能的基准,在「空间—自我」二维 ×「感知—记忆—推理」三层架构下评估多模态大模型,并配套提出融合光流与视觉特征的 运动感知表征,证明把「自我运动」显式建模进表征后,模型在感知、记忆乃至下游 UAV 决策任务上都会稳定提升。 UAV 上的 MLLM(多模态大模型)应用越来越…
长度惩罚让 Chain-of-Thought 更难被监控
用长度惩罚做 RL 后训练,会在「几乎不损失答案正确率」的前提下,系统性地抹掉 CoT 里能被 monitor 用来识别「答案到底受了什么影响」的关键证据,并由此揭示一条 compression–monitorability frontier:推理越压缩,监控器能看见的「影响来源」就越少。 CoT 监控(chainof…
面向探索、纯化与模型合并的谱重连(SAR)
提出 SubspaceAligned Rewiring(SAR):在后训练 / 模型合并 / 多领域训练三类场景里,把 LLM 的参数增量投影到「基模型的谱子空间」上做重连,仅保留 ~0.58% 的参数就能 保留 99% 以上的后训练增益,同时抑制推理早饱和、缓解多领域干扰,并且支持无需训练的跨领域模型合并。 RL 后…
潜空间世界模型的决策度量对齐:JEPA-MPC 的诊断与动作条件目标
针对 JEPA 类潜空间世界模型(LeWM)配合 CEM(CrossEntropy Method)做 MPC 时"潜空间欧氏距离 ≠ 真实任务进度排序"的失配问题,本文给出 PlanReal Spearman / CEMstage Spearman 两个无侵入式对齐诊断,并提出在潜空间模型上同时挂"逆向动力学头 + 演…
SemComp-Bench:面向视频生成的语义任务完成评估范式
本文为视频生成提出"语义任务完成(Semantic Task Completion Video Generation)"评估范式:成功标准是达成预定目标且与参考图保持任务相关的语义对应,而非传统的外观一致 / 中间步骤演示。配套提出 SemCompData(六大域评估集)与 SemCompBench(OA / GR 二…
视频选题榜 · 2026-08-14
v2 重写覆盖(承接 20260820 反思棒 §3"7 天最弱单篇"识别 · 覆盖原 v1 = 540 字节 / 9 行 / 3 entries / 与 814 T1440 v2 雷达 4 高价值 0 关联) 触发:20260820 21:40 CST 反思棒明确把 814 selection 列为 7 天(814 …
训练留痕:面向 LLM 溯源的 Centered Residual Signatures
仅凭模型权重即可判断两个 LLM checkpoint 是否存在亲缘关系——通过去除残差网络中共享的"恒等对齐分量"并比对 checkpoint 特异性结构,论文提出的 Centered Residual Signature 在多项测试中达到 AUROC=1.0,且比行为测试快 76 倍。 Openweight LLM…
突破故事中心:Attribute-Guided Genre Expansion 框架扩展创意写作数据
高质量创意写作数据长期被"故事文"垄断,限制了 LLM 对诗歌、说唱、剧本、游戏设计等结构性格式的掌握;通过将"主题广度"与"类型形式控制"解耦,论文的 AttributeGuided Genre Expansion 框架构建了一个 50K 样本、覆盖 13 种创意类型的 MultiGenre Collection,让…
SoftVTBench:可变形物体操作的安全感知视-触觉基准
现有可变形物体操作基准只看任务是否完成,忽视了滑落、过度挤压等不安全物理交互;SoftVTBench 在 Isaac Sim 中构建了有限元仿真环境,同步采集多视角 RGB、双指触觉 RGB、标记运动、本体感觉、语言指令和二元/连续夹爪动作,以 20 Hz 频率提供完整任务的 policy可见接触观测与独立物理 gro…
Co-RL:多智能体 RL 中由多样性同侪驱动的无监督推理
本文提出 CoRL 框架:让多个完全不共享参数的 decoupled 模型协同训练,互相以同伴输出作为 reward 信号,无需任何 groundtruth 标签即可驱动推理能力提升。核心发现是"同侪多样性(异质模型族 + 不同尺寸 + 数据改写)才是避免 selfrewarding 训练崩溃的关键杠杆",在文本与多模…
Zetta ζ:把具身 Agent Harness 从「开环反思」推到「动作级闭环自我进化」,并让 rollout 基础设施可异构扩展
一句话结论:冻结底座策略模型不动,靠「动作级 Critic → Rollout 级 CriticRecovery 候选优化 → 验证门控的技能更新」三条时间尺度解耦的闭环,把失败在线蒸馏为「可执行代码型 Critic + Recovery 工具集」;配合 ZInfra 这种「agent 逻辑与硬件解耦」的 rollou…
OmniScientist:把「AI 科学家」从「工作流自动化」推到「原始证据驱动的全模态全学科」研究闭环
一句话结论:用「感知层 + 3 个 ReAct Agent(ideation / experiment / writeup)」+「确定性流水线上的 idea / rigour / claim 三类代码层闸门」,让 AI 科学家直接吃「图像 / 波形 / 音频 / 视频 / 3D / 轨迹 / 表格 / 公式 / 图」9…
在训练时"擦掉"图像里一块——一篇 2017 年的论文,给整个视觉 AI 省了一大堆标注费
你有没有这种经历—— 训练好的图像识别模型,在笔记本摄像头里测试时表现挺好,但等部署到真实场景,遇到树叶把人脸遮半边、广告牌把车牌子压扁、人群里前后排互相挤这类情况时,精度哗哗往下掉。 这是 2017 年之前整个 CV 圈的痛:模型学的是"完整对象",真实世界里到处都是"被遮挡"。 一种解法是加更多真实遮挡的标注数据—…
让 AI 自己决定"该学哪个任务"——多任务学习那点调权重的破事,被一篇 2018 年的论文一次解决了
你有没有遇到过这种憋屈—— 想训练一个模型同时做三件事:判断图像的深度(远近)、画语义分割(每像素属于哪个类别)、做实例分割(把每个个体分开)。 直觉上挺合理:用一个网络、一张图、一次推理,全出了。 工程上这事难到爆:每个任务要算一个损失(loss),加起来训练——但三个任务的损失值天然不在一个数量级: 深度预测的 L…
视频选题榜 2026-08-20
· Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in LongContext Manifolds · deep LLM 潜空间天然组织为 SmallWorld 网络 + 任意语义锚点…
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
GigaWorldPolicy0.5 是一种 ActionCentered 的 World Action Model(WAM),通过 MixtureofTransformers 架构和 AutoResearch 超参搜索管道,在保持未来视觉动力学训练收益的同时,将机器人控制推理延迟降至 85ms(RTX 4090),实…
Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
Hallo4D 提出了"生成检测修正"(GenerationDetectionCorrection)范式,利用 LMM(大型多模态语言模型)对多视角和多帧渲染结果进行时空一致性检测,并引导基于共识驱动的图像空间优化,无需重训练或修改模型架构,即可显著缓解 3D/4D 内容生成中的空间幻觉和时间抖动问题。 3D/4D 内…
CoAL-RAG:复杂度感知的法律 RAG,让「单一检索策略」不再硬扛「单条退订」到「劳动连环案」的全谱问题
一句话结论:把「问题复杂度」从单一 tokenconfidence / 单一难度分类器升格为「5 维内在复杂度 × 检索一致性能量竞争」双轴评估,再以 3 档阈值在 4 条检索路径之间动态路由,使简单法条问答不必被知识图谱淹没、复杂多步推理性案件不会被纯向量检索的零碎片段带偏。 法律咨询问题的「复杂度方差」远高于通用 …
主题综述 · evaluation(2026-08-20)
date +%j=232, mod 8 = 0 → agent; surveys 目录近 72h 内 evaluation 主题未覆盖(最近一次 evaluation 综述 20260816,距今 ~96h 超 72h 跳过 → 20260812 evaluation 也已超 72h → 本期 evaluation 是…
PLENA:长上下文 Agentic LLM 推理的硬件—软件协同优化
PLENA 提出了一套面向 Agentic LLM 推理场景的硬件—软件协同设计系统,通过扁平化 systolic array、非对称量化与 FlashAttention 原生支持三条优化路径,在等量乘法器和等量内存配置下,把 LLaMA 系 Agentic 推理的吞吐相对 A100 / TPU v6e 分别提升到 2…
DeepSeek-V3 Technical Report
DeepSeekV3 是一个 671B 参数的 MoE(MixtureofExperts)LLM,激活参数仅 37B/token,通过 MLA 注意力、DeepSeekMoE、AuxiliaryLossFree 负载均衡、MultiToken Prediction(MTP)和 FP8 混合精度训练等创新,在仅 2.78…
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
该综述将 LLM Hallucination(幻觉)系统分为 InputConflicting、ContextConflicting、FactConflicting 三大类型,全面梳理了检测方法、评估基准和缓解技术,为 LLM 在真实场景中可靠部署提供了完整的知识地图;论文据 Semantic Scholar 估计被引…
Preference Is Not Intervention:读者特定证据效用的结构与稳定性边界
在 RAG 系统中,"不同模型偏好不同证据"这件事是真的,但稳定的偏好排序并不能授权"帮助/伤害"决策的跨读者迁移——论文用受控干预实验把"读者效用"拆成 activity、ordinal preference、conditional signed direction 三层,并证明前两层稳定、第三层塌方,得出"偏好 ≠…
EDITBRIDGE:面向忠实且高效的超高分辨率图像编辑
把"低分辨率编辑 + 独立超分"的两阶段 pipeline 重写成"扩散桥式 datatodata 翻译":以原 HR 图为条件约束、引入 priorguided blockwise sparse attention 把跨图交互限制在语义对齐区域,从而在 4K 分辨率下做到 61 秒实用编辑、2K 分辨率上 3.6–8…
跨模型记忆迁移:Engram 在目标侧靠 Reader 适配对齐
Engram 这种"外部哈希记忆表 + 小型 reader"的中间形态,跨模型迁移时记忆内容本身可以冻结,但能否真正被用起来,几乎完全取决于目标侧 reader 是否与目标 backbone 对齐——配上对齐的 reader,跨模型几乎追平同模型复用。 大模型的知识使用改进,长期被两条路线分治: 参数化适配(finet…