Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- Flash-dLLM:面向快速、内存高效的 Diffusion LLM 的 IO 感知 KV 缓存与并行解码 — Diffusion Large Language Model(dLLM)近期通过支持非自回归文本生成,成为自回归 LLM 的一种有前景的替代方案。然而,其实际……
- Agensh:将组织智能扩展到 1,024 个 Agent — 多 Agent 系统可通过并发执行来降低复杂任务的延迟,多项开创性的 harness 框架已支持多 Agent 系统。然而,其可扩展性……
- SpeakerMem-R1:面向多方对话的以说话者为中心的双轨记忆 — 多方场景下的长期对话记忆不仅需要从长期对话中检索相关内容,还必须区分谁说了什么、每句话对应谁……
- 超越重复采样:面向 LLM 推理的搜索策略学习 — 大语言模型越来越多地通过投入更多测试时计算来处理困难推理问题,但主流策略仍是朴素的重复采样:独立采样多个……
- 测量 Serving 栈而非模型:本地工具调用评估中的隐藏混淆因素 — 编码 Agent 必须在 harness 执行其选定动作之前,发出一条有效的工具调用——即符合所提供 schema 的可解析工具调用。我们研究本地 serving 栈……