解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
RARG:把"相关性"重新定位为 Agentic Search 的执行先验
RARG(RelevanceAware RipGrep Search Agent)把"相关性"从一个文档级的筛选分数,重新定位为"在语料里执行 grep 式交互时的执行先验"——它在粗到细三个粒度上引导直接语料交互(DCI):用文档级相关性决定 ripgrep 顺序、用段落级相关性初始化入口、用匹配片段级相关性重排,让…
InMind:定位 Agent 长期记忆的"隐式关联盲点"
InMind 是一个 125 题、专家验证、覆盖 10 个生活领域的 Agent 长期记忆评测基准。它揪出了一个长期被忽视的失败模式——隐式关联盲点(implicitassociation blind spot):当一条记忆和当前查询之间没有共享字面线索时(典型例子:"坚果过敏"→"马卡龙含杏仁粉"),现有六种主流向量…
VisualPatchWorld:用「代码世界模型」做规划,神经与符号的折中路线
VisualPatchWorld(VPW)把世界动力学表示为可执行的代码程序而非隐式神经网络:先用少量主动探针选定定性动力学形式(如线性、阻尼、弹簧),再用观测到的状态动作轨迹拟合参数;得到的程序既能像 simulator 一样向前 rollout,又能被人读懂、可编辑,并直接接入 modelpredictive co…
DINOv2:无监督学习鲁棒的视觉特征
DINOv2 证明了一个核心命题:只要在足够大、足够优质的精选数据上训练,自监督方法完全可以学习出通用的视觉表征,在图像级和像素级任务上均达到甚至超越专门训练的 SOTA 模型,且无需任何微调即可直接使用。 在 DINOv2 之前,NLP 领域的 Foundation Model 范式已经成熟——大规模无监督预训练产生…
BLIP-2:用冻结图像编码器与大型语言模型自举语言-图像预训练
BLIP2 提出轻量级 QFormer,通过两阶段预训练策略桥接 frozen image encoder 与 frozen LLM,在参数量减少 54 倍的前提下于多项 VLM 任务取得 SOTA,并首次展示了 zeroshot imagetotext generation 遵循自然语言指令的潜力。 VisionLa…
ReDesign:用 Agentic 分解从光栅图中"长出"可编辑设计稿
ReDesign 提出一个 LLM Agent 驱动的"自顶向下逐层扩张"框架:把一张位图反向拆成 Figma 可编辑的分层结构(typography / vector / color / grouping / layer order),并在每一次扩张后用"graceful verification"做局部接受/剪枝/…
Temporal-Distance JEPA:从离线轨迹中挖出「时间进度代价」,让 JEPA 规划器学会排序未来
TemporalDistanceJEPA(TDJEPA)保留 LeWM 的 encoderpredictor 主干,但额外从无奖励的离线演示轨迹中挖出一个「directed temporal cost」(同轨迹 step order 作正样本、跨轨迹作启发负样本、辅以 rolloutconsistency 正则),同时…
具备网络攻击能力的 AI Agent:漏洞、评估遏制与防御响应
这篇综述把"具备网络攻击能力的 AI agent"——即将 LLM、工具、记忆、执行环境缝合起来跑多步攻击性安全任务的系统——当成一个安全系统而非一个模型来研究:综合五类边界漏洞(多步攻击链、与沙箱边界冲突的目标、供应链与凭据暴露、持续 C2、自动化速度),并以 2026 年 7 月的 Hugging Face / O…
HANDBOOK.md:面向长上下文 Agent 的"政策遵循"基准
HANDBOOK.md 用 65 个企业级多步骤任务、5 个领域、20–124 页的"标准操作程序 (SOP)",把"系统提示/SOP 文档是否真能在长工具使用视野中约束住 Agent 行为"这件事量化成可重复实验,并暴露出当前最强模型在严格评分下也只能通过 36.2% 试次的系统性缺陷。 部署 LLM Agent 时…
Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings(HyPE)
HyPE 把"生成假设文档再做检索对齐"这件事从查询时搬到索引时,预先为每个文档块生成多条"假设提问"并以这些提问的嵌入替换原块嵌入,从而把检索变成"问题—问题"匹配,消除了 HyDE 的运行时开销并稳定提升检索质量。 RAG 系统长期存在 query–document 的"风格鸿沟":用户问的是短问句或口语化表达,而…
Multivariate Time Series Forecasting via Time-Frequency Graph Learning and Covariate Fusion(CrossRAG / TFGformer 题名分歧已标注)
作者提出 CrossRAG——把 RAG 思路第一次系统性地搬到多变量时间序列长期预测上:通过 ShapeAware Memory(SAM)+ RevIN 归一化解决跨源量纲不一致、用 FutureConsistent Contrastive(FCC)学习把"历史相似但未来不一致"的难负样本区分开、再用 CrossAt…
主题综述 · agent(2026-08-03)
本棒定位:本日 W5 综述轮换。date +%j = 215,215 mod 8 = 7,对应 risk。但 /shared/researchkb/organized/promo/surveys/20260803risk.md 已在 4.1 小时前写就(72h 内),按 cron 规则"顺延到下一个未覆盖主题"。最近 …
文生图的「文本条件」标度律:结构化语言越多,扩散损失越低
本文首次系统地测量了文生图扩散模型中文本条件的标度性质:收敛后的扩散损失随提示词中结构化语言量的增加近似线性下降(白盒 GPG 度量)并服从幂律(黑盒 ED 度量);据此同时提升 diffusability(给模型喂结构化提示)与 promptability(让模型自己生成结构化提示),最终在绝大多数组合 / 推理 /…
多参考图像编辑的一致性奖励:Evaluation-Verification Reward (EVR)
本文提出 EVR(EvaluationVerification Reward)——一种把多模态大模型拆成「评估器 + 验证器」两阶段、产出细粒度可靠奖励信号的方案,用于对多参考图像编辑模型做强化学习微调;在 QwenImageEdit 上即插即用,一致性与和谐度追平或超过 NanoBanana。 近一年的图像编辑模型(…
ExtractBench:第一份同时打分「准确性 + 完整性 + 引用 + 成本」的企业抽取基准
本文提出 ExtractBench——第一份在企业级 schema 引导文档抽取任务上同时度量「值准确率 + 记录完整度 + 引用接地 + 实测成本」的基准,含 4,869 页 / 370 份文档 / 8 个业务域 / 67 种文档类型;评测显示商业 VLM 在短文档上强但常截断长列表,coding agent 准但贵…
通过自蒸馏增强基于评分标准的强化学习:CriPO
CriPO(CriterionDistilled Policy Optimization)针对基于评分标准的强化学习中两类长期被忽视的失败模式——未探索评分项(Unexplored Criteria, UC) 和 被抑制评分项(Suppressed Criteria, SC)——通过 onpolicy 自蒸馏同时求解,…
Meshy T2:用 Flow Matching 实现快速原生网格生成
Meshy T2 提出一个用 flow matching 直接生成多边形 mesh 的统一框架:通过 vertexset mesh VAE 把整张 mesh 编码为每顶点一个连续 latent token,再用粗到细两级 flow(体素流勾勒体素占据骨架 + mesh 流补顶点与连接),实现 endtoend 6 秒生…
QQWorld:用分位数匹配重塑潜在世界模型正则化
QQWorld 把 LeWM 的 EppsPulley(EP)潜在分布正则换成分位数分位数(QQ)匹配目标,让"远离高斯"的孤立尾部样本也能获得有效梯度;并通过跨批 QQ 利用前一批 detach 样本扩大秩池,同时刻画其偏差方差权衡,在四个控制环境上一致提升规划成功率、改善高斯对齐并削薄潜在尾部。 潜在世界模型(la…
AI 到底"记不记得"?——arXiv 2607.25380 用三轴 + 四机制给"LLM 记忆"立了第一张统一地图
你有没有想过这件事 🧠: 你跟 AI 聊了三轮,前两轮你告诉它"我对青霉素过敏"、"我下周二有手术"、"我家猫叫胖橘"——第三轮你问"下周要注意啥",它能不能真用上前两轮的信息? 你公司想让 AI Agent 记住客户的偏好、上周的工单、三个月的对话历史——它能记多久?会不会记住旧的事实忘了新的?会不会某个事实记了 1…
让 AI 帮你改代码,先要让它"找对文件"——arXiv 2607.24882 给"代码 Agent 上游检索"立了第一把公开尺子
你有没有想过这件事 💻: 你让 Cursor / Copilot / Claude Code 帮你修一个 bug——它真正改对代码之前,其实要先做一件很基础的事:在仓库里把"需要看的文件"找出来。 这一步如果找错了——比如改了一个看似相关的文件、漏掉了真正被依赖的测试,或者拿了几个字面相似但其实用不上的文件——后面再聪…
视频选题榜 2026-08-03
· Beyond Semantic Organization: Memory as Execution State Management for LongHorizon Agents · MAGE = 把 Agent 记忆从「语义相似度检索」重构为「分层执行状态树管理」+ Grow/Compress/Maintain/…
主题综述 · risk(2026-08-03)
今天轮换命中 risk(年积日 215 % 8 = 7)。距离上一份 risk 综述(20260730)已有 4 天;近 72 小时内 surveys/ 目录未覆盖 risk 主题,因此今日落地。综合材料:paper_cards 中主分类 = risk 的 15 篇、最近 7 天 inbox/spark/flyp/to…
CodeNib:面向编码 Agent 的多视图仓库上下文服务数据系统
CodeNib 将 Coding Agent 的仓库上下文问题重新定义为数据系统问题:针对每个仓库提交(commit)一次性构建词法、稠密向量和结构三类视图并维护各自的增量更新路径,以单一运行时同时提供排序搜索、符号导航和有界上下文服务,相比重复重建索引提速 8.7×~25.4×,同时将 Agent 的轨迹 token…
跨文本、表格与知识图谱的知识不一致检测
Kontrast 把"同一事实散落在 Wikipedia 文本、表格和 Wikidata 知识图谱中、相互打架"这一长期积弊,第一次正式定义为"模态级不一致检测"任务,并给出一套基于 TexttoSPARQL + LLM 推理的自动化框架;同时贡献了一套可公开复现的表问答基准,证明跨模态冲突既真实可测,也能反过来用作"…
超越自我认知:在 LLM 推理与检索间传播不确定性
BeyondUncertainty 用黑盒 LLM 自报的言语化置信度(verbalized confidence)做"是否需要检索"的门控路由:在 27,000 个策略实例(6 个 QA 基准 × 3 个模型族 × 3 种检索策略)上,把平均 token 级 F1 从"总是检索"的 0.467 抬到 0.483,同时…
Agent Retrieval Bench:把"代码 Agent 仓库检索"从直觉变成可测基准
Agent Retrieval Bench 把"代码 Agent 在动手前能不能先把仓库里需要的文件找出来"这件事单独抽出来做 filelevel 评测:427 条样本 / 25 个仓库 / 5 类子任务 / 308 个 basecommit 快照 / 7.9M 个 chunk,结论是没有一类检索方法能压倒其他方法,且…
RLHF Reward Model 推理能跑多快?ONNX Runtime + C++ vs PyTorch 的系统研究
作者用基于 ONNX Runtime 的原生 C++ reward model 推理引擎跟 PyTorch eager、torch.compile、FastAPI 三类基线做对照,发现在 CPU 上 C++/ONNX 大幅领先,在 GPU 上 C++/ONNX 击败 PyTorch 与 FastAPI 但输给 torc…
UAV 高光谱 PFM-1 地雷检测中的人在回路签名引导
PFM1 地雷的 UAV 高光谱检测不是「识别一个光谱匹配」,而是一场关于核查成本的博弈:算法必须把「多少个候选点需要人去现场复查」压到两位数以内;本文证明 ACE(自适应相干估计器)+ 全量人工签名引导 只需两轮共 9 次候选复查即可确认全部 7 个目标区,而 SAM 即使配合人机协同也要上千次候选复查。 高光谱成像…
Grading the Narrators:把伊斯兰圣训学的溯源方法搬进多 Agent 知识系统
本文把「伊斯兰圣训学(hadith science)千年沉淀的 isnad(传述链)+ rijal(传述者评级)」方法论形式化迁移到多 agent 知识系统,给出声明级(claimlevel)溯源的关系型 schema、最弱链评估、独立链互证、内容批评与链路评级解耦等机制,并在 20,000 条真实物理教材声明上做了实…
培养 Agentic 工程师:AI 时代的课程、协作与持续学习
这是一篇概念综合(integrative conceptual synthesis)型文章,主张随着生成式与 agentic AI 重构软件工程,培养重心必须从「人类亲手写工件」转向「指导、验证、治理自主系统」,,并以 ACCEL 框架(Agentic Competencies through Curricula, C…