视频选题榜 2026-07-26

  • https://arxiv.org/abs/2607.20734 · LLMs Get Lost in Evolving User Intent · 单轮 Fully-Specified 性能无法迁移到多轮 evolving-intent 场景,各模型家族均出现显著性能下降 · round=R1
  • https://arxiv.org/abs/2607.21485 · Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation · 共享正弦块反复迭代,通过 Jacobi-Anger 诱导谐波线谱,递归展开持续富化 INR 的有效频谱支持,RGB / 超分 / NeRF / SDF 任务均显著优于前馈 INR · round=R2
  • https://arxiv.org/abs/2607.20911 · Tencent WorkBuddy Bench · A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction · 当前主流 coding benchmark(SWE-bench 系列)任务通过 web search 原始 issue 可恢复,数据污染导致分数虚高;WorkBuddy 提出四工作域(Code/Web/Office/Security)统一 task-directory format + 每条任务从真实 commit/PR/业务场景反向工程重写为口语角色扮演请求 + dataset versioning + 双 harness(CodeBuddy Code + Claude Code)评测 + 跨子集分数明确不可比 + 全文开放可审计 · round=R3