推广选题榜 · 2026-09-28

基于近 30 天论文卡片,从「被引 + SOTA + 新近度 + 话题热度」综合选 Top 8。


1. PUBG Ally:作为 AI 队友的对话式具身 Agent arxiv: 2609.29837

让 AI 在真实游戏(PUBG)中充当语音队友——同时处理实时游戏感知、玩家语音理解和动作同步。展示了 Agent 工具调用与实时控制结合的可行路径,是目前最具可玩性的具身 AI demo 之一。 → 建议形式:深度解读 + 游戏 demo 视频


2. OmniEchoBench:面向具身智能体的空间音频理解基准 arxiv: 2609.23407

首个统一评估空间音视频感知与音-视-语言导航的基准,覆盖 197 个真实场景、2972 问答对。填补具身 AI 在听觉维度上的评估空白,话题热度高。 → 建议形式:科普 + benchmark 解读


3. LatentPort:混合语言模型循环记忆的跨模型迁移 arxiv: 2609.25053

首次实现不同规模混合语言模型(Qwen3.5 4B→9B)间的持久状态跨模型交接,无需目标前缀重放。为 KV Cache 之外的长上下文推理开辟新方向,工程意义突出。 → 建议形式:深度解读(LLM infra 从业者必读)


4. AV-GRPO:模态锚定解耦扩散强化学习用于联合音视频生成 arxiv: 2609.29816

针对联合音视频生成中多模态奖励纠缠与计算开销问题,提出模态锚定解耦后训练方法。这是今年 AVM 生成方向的硬核进展,适合技术受众。 → 建议形式:深度解读


5. GameHorizon Suite:游戏中的多时间历程数据与评估 arxiv: 2609.25001

统一评估 AI 模型跨短期/中期/长期游戏能力的 benchmark,覆盖多种游戏类型与模型家族。游戏 AI 是 Agent 能力的重要试金石,这个基准覆盖全面且实用。 → 建议形式:科普 + 评测对比


6. E2A-Bench:金融图表推理证据到行动可靠性基准 arxiv: 2609.14302

面向金融 VLM 的 969 查询 benchmark,基于 HS300 成分股构建,强调评估应覆盖完整证据链而非单一幻觉分数。金融 AI 落地热度持续,这个方向刚需明显。 → 建议形式:深度解读(金融 AI 场景)


7. AgentAudit:AI Agent 全生命周期信任评估框架 arxiv: 2609.09875

从指令完整性、规划器、记忆、工具选择、工具正确性等十个维度对 Agent 执行轨迹进行全链路审计。目前最系统的 Agent 评估框架,工具层面价值高。 → 建议形式:深度解读 + 实操演示


8. ShallowStream:先浅层索引再深层回答的流式视频理解 arxiv: 2609.02780

利用 MLLM 浅层同时做帧编码与检索索引,将单帧 prefill 延迟和端到端延迟分别降低 52 倍和 12 倍。视频理解加速方向突破性强,工程收益显著。 → 建议形式:科普 + 性能对比可视化