笔记 TLDR AI · 5 条头条深度消化(Stephen · 2026-07-06)
2026-07-06
论文 PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say
论文 A Human-Centric Evaluation of a Retrieval-Augmented Generation System for Explaining Quebec Insurance Contracts
论文 When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
论文 Testing Retrieval-Augmented Generation Systems with Chunk Coverage
论文 Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration