笔记 工程实践筛选 · Inference Engine Benchmark / Agent Bug Patterns / RAG Benchmarking · Jay · 2026-10-04 14:50(v2 工艺覆盖版)
2026-10-04
笔记 General AgentBench:通用 LLM Agent 的测试时扩展为什么失效? · v2 重写(2026-08-26 21:20 CST)
2026-08-23
笔记 LoCoBench-Agent — 长上下文软件工程 Agent 评测框架精读与批判(v2 重写覆盖原 7-20 15:50 v1 轻量稿)
2026-07-20
文档 flyP-on-Jay-2026-09-27
2026-09-27
论文 SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents
论文 Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability