ACL 2026 System Demonstrations | 精选解读

来源:Papers.cool ACL.2026 System Demonstrations
整理:Jay | 日期:2026-08-03
注:本列表为 papers.cool 实时索引,ACL Anthology 正式记录可能略有差异


精选条目

#18 ArcLight — 面向 Many-Core CPU 的轻量级 LLM 推理架构

  • 论文ACL 2026 Demo
  • 作者:Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che
  • 核心贡献:在 CPU(Many-Core)而非 GPU 上运行 LLM 推理的轻量化架构,针对 CPU 特性重新设计 attention kernel 和内存布局
  • 工程价值:⭐⭐⭐⭐ — 适合 CPU 推理、边缘部署、无 GPU 环境的 LLM 应用
  • 建议行动:下载论文,对比 llama.cpp、Ollama 的 CPU 推理策略

#3 PROTEA — 多 Agent LLM 工作流离线评测与迭代改进

  • 论文ACL 2026 Demo
  • 作者:Kazuki Kawamura, Satoshi Waki, Kei Tateno
  • 核心贡献: 1. 执行工作流 + 可配置评估器对中间 artifact 评分 2. Backward Node Evaluation:从终端监督推导每节点理想输出,解决中间参考标注难题 3. 自动生成 prompt patch diff,重新运行验证前后差异 4. 统一 UI 覆盖:瓶颈定位 → 半自动修复 → 结果验证
  • 工程价值:⭐⭐⭐⭐⭐ — 填补多 Agent 调试工具链空白
  • 建议行动优先关注,建议列入 Agent 开发工具链核心参考

#21 Rankify — 检索/重排/RAG 全流程 Python 工具包

  • 论文:ACL 2026 Demo
  • 核心贡献:统一 Python 工具包,覆盖 Retrieval + Re-ranking + RAG 全流程
  • 工程价值:⭐⭐⭐⭐ — 工程可用性强,减少三方库拼装
  • 建议行动:核实 GitHub 代码库状态,评估 vs现有工具链(LangChain RAG、Haystack)

#19 DialogGuard — 多 Agent 心理安全评估系统

  • 论文:ACL 2026 Demo
  • 作者:Michigan/Duke/others(待核实)
  • 核心贡献
  • 审计商业治疗聊天机器人在临床场景中仅 ~50% 情况响应适当
  • 4 个 LLM-as-judge pipelines 评分 5 个心理安全维度(操纵、歧视、心理困扰等)
  • 关键发现:Persuasive Strategy "Pathos" 将 copyright leakage ROUGE-L 从 ~0.1 提升到 ~0.7
  • 工程价值:⭐⭐⭐⭐ — AI 安全合规工具,生产部署审计价值
  • 建议行动:建议列入"Agent 安全评估"主题页;关注 Streamlit 部署的 live demo

#23 GovScape — 7000 万政府 PDF 多模态搜索系统

  • 论文:ACL 2026 Demo
  • 核心贡献:面向 7000 万页政府 PDF 的大规模 RAG pipeline
  • 工程价值:⭐⭐⭐⭐ — 超大规模 RAG 架构参考
  • 建议行动:关注 PDF OCR + 向量索引 + 检索的端到端架构设计

#1 Interpreto — Transformer 可解释性库

  • 论文ACL 2026 Demo
  • 作者:Thomas Mullor, Gabriele Sarti, Frédéric Bois私立 et al.
  • 核心贡献:开源 Python 库,覆盖 attribution 方法 + concept-based explanation,支持 BERT 到 LLM 全家桶
  • 工程价值:⭐⭐⭐⭐ — 模型可解释性工具,与 LangChain/LLMWorkspaces 生态可集成
  • 建议行动:建议评估 vs Captum、SHAP 等现有可解释性工具

  • 论文ACL 2026 Demo
  • 作者:Guangwei Zhang, Neil Zhenqiang Gong, Rada Mihalcea, Bo Li et al.
  • 核心贡献
  • 多范式版权检测:内容召回测试、释义级相似度分析、Persuasive jailbreak 探测、去学习验证
  • 关键发现:Persuasive "Pathos" 策略将 GPT-4o-mini 的泄露分布从 ROUGE-L 0.1 推到 0.7
  • 工程价值:⭐⭐⭐⭐ — LLM 版权合规审计工具
  • 建议行动:关注与 red teaming 工具链的集成

综合建议

条目 优先级 适合主题页
PROTEA ⭐⭐⭐⭐⭐ Agent 工程工具链
ArcLight ⭐⭐⭐⭐ LLM 推理系统(CPU 路径)
Interpreto ⭐⭐⭐⭐ LLM 可解释性
DialogGuard ⭐⭐⭐⭐ AI 安全与合规
Rankify ⭐⭐⭐⭐ RAG 工程工具链
Copyright Detective ⭐⭐⭐⭐ LLM 安全合规
GovScape ⭐⭐⭐ 大规模 RAG 参考