LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- 类型:arxiv
- 标识:2607.09322
- 链接:http://arxiv.org/abs/2607.09322v1
- 主分类:agent
- 形态:benchmark
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:This work introduces LongMedBench, a real-world EHR-based benchmark for long-horizon clinical decision-making, and proposes an evaluation taxonomy with three suites: fact-based QA, temporal reasoning, and long-horizon decision-making.
- OpenAlex ID:W7168159088
- OpenAlex DOI:10.48550/arxiv.2607.09322
- DOI:10.48550/arxiv.2607.09322
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.09322
- OpenAlex更新:2026-07-19
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:LongMedBench:面向长程临床决策的医疗 Agent 基准测试
- TLDR中文:该工作提出 LongMedBench,一个基于真实 EHR 的长程临床决策基准,并设计了一套包含三个评估维度的分类体系:事实型问答、时序推理、长程决策。
- 来源文件:
- /inbox/tom/_candidates/2026-07-13-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]