DataSpace:在异构工作空间上做可验证表格分析的数据 Agent 基准
- 关联论文:2608.03451
- 作者:flyP
- 更新:2026-08-08
一句话结论
DataSpace 是一个让数据 Agent 在「任务本地异构工作空间」上直接产出可校验表格结果的基准:410 个跨语言任务、7439 个 artifact、合计 15.01 GB,覆盖 CSV / JSON / SQLite / Markdown / PDF / 视频等模态;六款前沿多模态模型的最佳准确率仅 66.34%,且 harness 选择在固定 backbone 下能造成 15.36 分差距——基准尚未饱和,且揭示了多模态证据整合与跨表 join 仍是公认薄弱环节。
解决什么真问题
已有数据 Agent 基准大多各自只考察一个能力切片:
- BIRD / Spider 类只考察结构化 SQL;
- 检索类基准只考察从长文档或网页里取证据;
- 开放式分析基准多以「自然语言报告」为输出,难以做严格匹配。
但真实企业场景里,一个问题可能同时涉及数据库、结构化文件、长 PDF、视频字幕,且最终需要给出一张完整的可校验表格。DataSpace 想把「异构证据发现 + 完整表格输出 + 确定性评估」三件事第一次统一起来。
核心方法
任务形式
- 输入:
question+ 任务本地的异构工作空间(databases、files、documents、multimedia),agent 不能访问外网或外部 schema。 - 输出:完整请求的表格结果(structured tabular result),而不是自然语言答案。
- 评测:确定性 evaluator,按 header-invariant 列对齐 + 类型与精度归一化 + 顺序敏感的 row 比较。
构造管线:DataSpace-Builder
# DataSpace-Builder 的 4 步流水线
1) cross_language_transformation # 跨语言 schema/字段映射
2) constraint_aware_rel_sampling # 受约束的关系采样
3) modality_routing + artifact_render # 模态路由 + 多模态 artifact 渲染
4) human_review_and_task_repair # 11 位领域专家 review & 任务修复
四步分别负责:把多语言 schema 对齐、在关系上做有约束的子集采样、把多模态 artifact 渲染进工作空间、以及最后的人工把关。
确定性评估器
pred_table = agent.run(question, workspace)
gold_table = ground_truth
aligned = column_align(pred_table, gold_table) # header-invariant
norm_pred = normalize(aligned, by=type_and_precision)
norm_gold = normalize(gold_table, by=type_and_precision)
score = row_compare(norm_pred, norm_gold, order_aware=True)
- 列对齐不依赖列名,只看内容;
- 数值精度、类型(如 int vs float)做归一化;
- 行比较是 order-aware,避免靠随机排序蒙混。
关键实验与数据
- 数据规模:410 个跨语言任务、7439 个 artifact、合计 15.01 GB,覆盖 CSV / JSON / SQLite / Markdown / PDF / 视频。
- 官方比赛身份:作为 KDD Cup 2026 Data Agents for Complex Data Analysis 的官方评测基准。
- 模型与 harness:评估 6 款近期发布的前沿多模态模型 × 5 款主流 agent harness。
- 主结果:
- 最佳准确率 66.34%(最佳 backbone × best harness 组合),整体未饱和;
- 固定 backbone 时,harness 选型可造成 15.36 个百分点的差距,说明 harness 比 backbone 更直接决定可用性。
- 跨切片的负向观察:多模态证据整合(multimodal evidence integration)与跨表 join 在 6 个 backbone 上全部拉低准确率——它们是公认的「失败模式」。
亮点与局限
亮点
- 统一三件套:异构证据发现 + 完整表格输出 + 确定性评测,第一次在同一基准里闭合;
- 真材实料:15.01 GB / 7 种模态 / 跨语言 / 11 位领域专家 review,比纯合成 benchmark 更有外部效度;
- 比赛背书:作为 KDD Cup 2026 官方评测,会带动一拨独立可比的提交结果;
- 建设方法可复用:DataSpace-Builder 的四步管线本身可被复用去造新基准。
局限(反方 / 边界段)
- 未饱和 ≠ 困难:66.34% 仍说明任务对当前 SOTA 尚有挑战,但具体任务难度分布、随机基线表现 abstract 未列;
- 基线数量有限:只测了 6 个 backbone × 5 个 harness,对开源小模型、轻量级 pipeline 的覆盖 abstract 未给;
- 跨模态证据整合负向:作者自己也承认这是「一致降低准确率」的能力,等于宣告 benchmark 这一维度仍未被解决;
- 依赖人工:每条任务 11 位专家 review,规模再扩大会成为瓶颈。
对工程落地的启发
- 数据 Agent harness 选择 > backbone:固定 backbone 也能差 15 分,意味着工程团队应把 harness 抽象成可插拔模块,先优化调度与工具调用策略,再讨论换更大的 LLM。
- 可验证输出是落地关键:企业内场景天然要可校验表格,DataSpace 的 deterministic evaluator(header-invariant + 类型/精度归一 + order-aware)几乎可以直接复用到内部评测。
- 跨模态证据整合仍是盲点:RAG / 多模态方案在 PDF + 视频 + DB 混合场景普遍吃力,是后续半年的明确工程方向。
与同方向工作的关系
- BIRD / Spider:聚焦 SQL 文本生成,DataSpace 把能力面扩展到跨模态;
- MTEB / LongBench:聚焦 retrieval / 长上下文;DataSpace 把指标压到「最终表格」;
- DA-Agent / Code-Agent 类评测:偏向开放式自然语言回答,DataSpace 是其「确定性对照版」;
- KDD Cup 系列:DataSpace 作为 KDD Cup 2026 的官方基准,会形成可比较的提交链路。
适合谁读
- 搭建企业知识库 / 数据助手 / RAG 平台的工程师,需要可校验评测;
- Agent / Tool-use 方向研究者,关注 harness 设计对真实任务的影响;
- 准备 KDD Cup 2026 Data Agents 比赛、希望先理解任务结构的参赛队;
- 数据治理 / 数据中台团队,关心跨模态工作空间下「如何验」。
复现与代码
原 abstract 未直接给出官方代码 / 数据仓库链接;后续以论文附录与 KDD Cup 2026 Data Agents 赛道的官方页面为准。
不确定处
- 6 款 backbone 与 5 款 harness 的具体名单 abstract 未列;
- 随机 / 启发式基线分数 abstract 未列;
- 训练 / 推理硬件与单任务时延 abstract 未列;
- 评测数据集是否允许下载与商用授权 abstract 未列;
- 「跨语言」涉及哪些具体语言 abstract 未列。
工程落地与核查(Jay)
事实核查
- 66.34% 准确率:paper card 与 abstract 一致,可信。
- harness 选型 15.36 分差距:abstract 原文一致;此数字意义重大——意味着 harness 是工程杠杆而非模型,团队应优先投入 harness 设计与评测,而非盲目换模型。
- KDD Cup 2026 官方基准:paper card 确认此信息,可信。
- 410 任务 / 7439 artifact / 15.01 GB:paper card 与 abstract 一致,可信。
- 6 backbone × 5 harness:abstract 数字可信;具体型号需等正文。
- 无代码链接:abstract 确实未给;KDD Cup 通常在比赛页提供 baseline 代码,需关注 2026 年赛页。
可读性精修
- 「跨表 join 仍是公认薄弱环节」建议改为「跨表 join 在 6 个 backbone 上均一致拉低准确率,是当前基准中最显著的失败模式」——原表述「公认薄弱环节」偏软,「一致拉低准确率」更有数据支撑。
- 「未饱和 ≠ 困难」表述稍绕口,建议改为「66.34% 说明任务仍有实质挑战,具体随机基线与难度分布待正文披露」更直接。
工程落地路径
企业内部评测体系搭建(立即可行动):
# DataSpace Deterministic Evaluator 的最小可搬写版本
def evaluate(pred_table, gold_table):
# 1. 列对齐(header-invariant:只按内容,不按列名)
aligned_cols = column_align_by_content(pred_table, gold_table)
# 2. 类型/精度归一化
for col in aligned_cols:
if col.type in ('int', 'float'):
col.normalize(by='precision') # 1.0 与 1.00 等价
# 3. 行比较(order-aware)
score = row_compare(aligned_cols.pred, aligned_cols.gold, order_aware=True)
return score
# 工程嵌入点:替换现有 RAG/Agent 的「文本相似度打分」
# 旧方案:embedding similarity → 主观
# 新方案:表格 row-match accuracy → 客观
harness 设计优先级(从 DataSpace 结论倒推):
harness 选型 15 分差距意味着:
1. 工具调用策略(ReAct / PlanAct / ToolLoop)> backbone 选型
2. 多模态路由顺序(先 PDF 还是先 DB)显著影响跨模态准确率
3. 中间结果缓存(避免跨模态重复解析)是低成本高收益工程点
生产环境部署风险:
- workspace 隔离的工程成本:DataSpace 的「任务本地异构工作空间」要求每个任务有独立文件系统快照——410 个任务 × 15.01 GB 总量,生产部署需要隔离存储与快速环境切换,建议用 docker overlayfs 或 namespace 隔离。
- PDF/视频 等大 artifact 的 token 消耗:15.01 GB ÷ 7439 ≈ 2 MB/artifact,平均单任务涉及多个 artifact;多模态模型对 PDF 的 tokenization 成本(时间 + money)需要在 pipeline 设计时做预估,避免长尾任务超时。
- harness × backbone 的组合数爆炸:6 × 5 = 30 种组合,生产调优若遍历需大量资源;建议先用固定 harness(如 ReAct)+ 多 backbone 筛选出最优 backbone,再固定 backbone 优化 harness。
- 跨语言任务的 locale 设置:跨语言 schema 映射(cross_language_transformation)是 DataSpace-Builder 的第 1 步,locale 配置(如中文 CSV 列名 vs 英文列名)直接影响 agent 能否正确理解字段语义,需提前梳理企业数据 schema。
KDD Cup 2026 参赛工程建议:
- 重点投入 harness 的「表格输出校验循环」:在 agent 生成表格后,用规则引擎做预校验(列类型、数值范围、非空约束),再提交给 evaluator——相当于多一层 self-check。
- 数据下载:KDD Cup 通常提供数据集下载页,关注 2026 年赛页开放时间;15.01 GB 数据集需准备 ~50 GB 磁盘空间(含解压与工作空间副本)。
- 参考已有 KDD Cup Data Agents 赛道的 baseline 思路(ReAct + code interpreter + SQL tool + PDF tool),在 DataSpace 的 evaluator 框架下迭代。