evaluation · E1 预消化简报(2026-08-25)
信源检查记录
本次覆盖(窗口:2026-08-23 15:40 ~ 2026-08-25 15:40 CST):
- work-queue.md ✓(Top 15 无 evaluation 专项净新增;ASI-Bench 衰减跌出确认;无 eval 专项结构性新增)
- inbox/tom(8-23~8-25):2026-08-25-agent-rag-longcontext-radar(PV-SST ★ + FlavourBench ★ + EnSI-RAG ★)+ 2026-08-25_agents-lite(AID-Guard + PV-SST + Specification Portability)+ 2026-08-25-inference-e1prep(无 eval 专项)+ 2026-08-25-rag-e1prep ✓;2026-08-25-evaluation-e1prep R56 基线确认 ✓
- inbox/flyp(8-23~8-25):2026-08-25-0507-reliability-science-long-horizon-agents-critical-read(Reliability Science Framework + HORIZON 双稿 ★★★ P0 反方立基础锚)+ 2026-08-25-coding-agents-e1prep(已含 evaluation 邻接增量)+ 2026-08-25-multimodal-e1prep(含 CPI-Bench evaluation 主分类)✓
- inbox/jay(8-23~8-25):2026-08-25-0510-jay-engineering-articles-secondary-filter(LongHorizon-Harness + Self-Harness + c-CRAB)+ 2026-08-25-inference-vector-k8s-agent(pgvectorScale 10× QPS 量化)+ 2026-08-25-agent-eval-debugging-production(★★★ AgentDebug + Datadog State of AI Engineering + awesome-harness-engineering)✓
- inbox/spark(8-23~8-25):2026-08-25-agent-e1prep(Reliability Science Framework + HORIZON 已升 ★★★ + 41 种失败模式分类学 + MCPTox + Gartner eval 平台拐点)+ 2026-08-25-llm-infra-e1prep ✓
- inbox/stephen(8-23~8-25):无 evaluation 直接增量 ✓
- paper_cards 近 3 天新卡(1058~1068 范围):1063(PV-SST,agent 主分类 eval 邻接)+ 1064(FlavourBench,evaluation 主分类)+ 1060(Dis2Pat,evaluation 主分类)+ OmniAssistBench(HF Daily 8-25 #12 27▲,paper_card 未建,eval 邻接)+ Beyond Correctness(HF Daily 8-25 #14 19▲,eval 邻接,paper_card 未建)+ AgentDebug(GitHub UIUC,eval 邻接,paper_card 未建)✓
- HF Daily 8-25:EnvHarness 258▲(#1,新高)+ FACET 115▲(#2)+ OmniAssistBench 27▲(#12,新晋)+ Beyond Correctness 19▲(#14,新晋)+ ASI-Bench 衰减确认 ✓
- knowledge/evaluation.md R56 基线确认 ✓(harness 生态六角 + 评测方法学 35 轴 + 23 元组 + 89 件套 + 立标池双向锚第 13-14 日信号 + Reliability Science Framework P0 反方立基础锚 + Rethink/Zetta+SemaPLC 方法学质疑对位临界)
增量摘要
本轮(E1-R57,窗口 2026-08-23 下午 ~ 2026-08-25 下午)eval 主题 eval 专项 net-new paper_card 为 0 条(无新建 eval 主分类 paper_card);eval 邻接候选新增 3 条(OmniAssistBench + Beyond Correctness + AgentDebug)。
本轮最重要增量:Jay 8-25 下午工程筛选出的 AgentDebug(UIUC)+ Datadog State of AI Engineering 2026 —— 工程化评测体系两条新锚,填补了"生产环境真实错误分类"和"可执行 benchmark 落地"的空白,与学术 benchmark 设计形成互补。另有 HF Daily 8-25 OmniAssistBench 新晋锚(27▲)+ Beyond Correctness 新晋锚(19▲),以及 EnvHarness 258▲ 创历史新高(第 14 日信号扩张)。
条目一:OmniAssistBench — 助手风格交互评测基准(eval 邻接 ★,paper_card 未建,HF Daily 8-25 新晋锚 #12 27▲)
来源:HF Daily 2026-08-25(#12 27▲);paper_cards/ 范围无建卡记录
arXiv:2608.21360
主分类:evaluation(邻接);形态:benchmark
要点
- 核心发现:OmniAssistBench——Assistant-style Interaction Benchmark for Omni-LLMs;评测 Omni-LLM(全能大模型)在助手风格交互场景下的行为表现;从 HF Daily 8-25 数据看,社区关注度 27▲ 新晋 top 15
- 关键贡献:填补"助手风格交互评测"空白——助手类 Agent(客服/个人助理/协作写作)行为与工具执行类评测的维度差异显著;多模态输入(图像+语音+文本)的助手交互给评测带来新维度
- 立标信号:HF Daily 8-25 #12 27▲ 新晋;paper_card 未建
与 knowledge/evaluation.md R56 现有脉络的关系
- 现有脉络:R56 §2.7 评测对象 86 维;§2.2 评测对象邻接(The Embedder's Dilemma + CPI-Bench);OmniAssistBench 补充"助手风格交互评测"空白,属于 §2.7 评测对象邻接(助手类 Agent 交互评测维度候选)
- 建议归入节:§2.7 评测对象邻接 → OmniAssistBench(助手风格交互评测);§2.2 评测对象邻接(Assistant-style Interaction Benchmark)
矛盾 / 待核实
- Omni-LLM 具体涵盖哪些模态组合(文本+图像+语音?)
- 评测指标是否区分"任务完成率"和"交互风格自然度"两个维度
arXiv 列表
- 2608.21360(❌ paper_card 未建;eval 邻接;HF Daily 8-25 #12 27▲ 新晋锚)
条目二:Beyond Correctness — 混合思维 MLLM 行为对齐评测(eval 邻接 ★,paper_card 未建,HF Daily 8-25 新晋锚 #14 19▲)
来源:HF Daily 2026-08-25(#14 19▲);paper_cards/ 范围无建卡记录
arXiv:2608.12781
主分类:evaluation(邻接);形态:benchmark
要点
- 核心发现:Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs——混合思维(hybrid-thinking)MLLM 的行为对齐评测;超越正确性本身,聚焦"行为一致性/安全性/风格"等维度
- 关键贡献:首次系统性地把"行为对齐"作为独立评测维度引入混合思维 MLLM;为"答案正确但行为不当"的评测盲区提供量化框架
- 立标信号:HF Daily 8-25 #14 19▲ 新晋;paper_card 未建
与 knowledge/evaluation.md R56 现有脉络的关系
- 现有脉络:R56 §2.1 评测方法学 35 轴;§2.6 失败模式反方体系(已有 Rethink/Zetta/SemaPLC 方法学质疑);Beyond Correctness 补充"行为对齐评测"维度,与传统"答案正确性评测"形成互补,属于 §2.1 评测方法学邻接(行为对齐评测轴候选)
- 建议归入节:§2.1 评测方法学邻接 → Beyond Correctness(行为对齐评测轴);§2.6 失败模式反方体系邻接
矛盾 / 待核实
- "行为对齐"的具体评测指标是否有人类标注一致性验证
- Hybrid-thinking MLLM 的定义边界是否清晰
arXiv 列表
- 2608.12781(❌ paper_card 未建;eval 邻接;HF Daily 8-25 #14 19▲ 新晋锚)
条目三:AgentDebug — 17 种 Agent 错误分类 × 5 模块(eval 邻接 ★★,GitHub UIUC,paper_card 未建,Jay 8-25 工程筛选高价值 ★★★)
来源:inbox/jay/2026-08-25-agent-eval-debugging-production.md(Jay 8-25 工程筛选 #2 高价值)
URL:https://github.com/ulab-uiuc/AgentDebug
主分类:evaluation(邻接);形态:tool/methodology
要点
- 核心发现:AgentDebug(UIUC NLP/SE Lab)提出 AgentErrorTaxonomy:17 种错误类型 × 5 模块(memory / reflection / planning / action / system);AgentErrorBench:ALFWorld、GAIA、WebShop 失败轨迹标注数据集;两阶段调试 pipeline:隔离根因 + 纠正反馈
- Action 模块错误:misalignment、invalid_action、format_error、parameter_error
- System 模块错误:step_limit、tool_execution_error、llm_limit、environment_error
- 关键贡献:首次提供系统性 Agent 错误分类法;为"eval 驱动的 debug"提供可执行方法论;5 模块覆盖 Agent 架构全栈;MIT license + 有源码和数据集
- 立标信号:Jay 8-25 ★★★ 高价值;UIUC 学术背景;paper_card 未建
与 knowledge/evaluation.md R56 现有脉络的关系
- 现有脉络:R56 §2.6 失败模式反方体系 43 层;§2.207 评测方法学 27 元组;AgentDebug 补充"Agent 错误分类法"空白——5 模块 × 17 类型提供比"Rethink 单基准依赖批判"更细粒度的错误归因体系,属于 §2.6 失败模式反方体系邻接(细粒度错误分类法候选)
- 建议归入节:§2.6 失败模式反方体系邻接 → AgentDebug(17 种错误 × 5 模块);§2.207 评测方法学邻接(两阶段调试 pipeline)
矛盾 / 待核实
- 17 种错误类型的分类标准(是否有 Cohen's kappa 验证——与 spark 8-25 提到的 41 种失败模式分类学 arXiv:2607.28802 Cohen's κ=0.76 是否有关联或重叠)
- ALFWorld / GAIA / WebShop 失败轨迹的规模(具体多少条)
- 与 41 种失败模式分类学(arXiv:2607.28802)的关系:17 种 vs 41 种,覆盖度差异
arXiv 列表
- 无 arXiv(GitHub 工具,非论文);来源:https://github.com/ulab-uiuc/AgentDebug
综合:立标池双向锚第 14 日信号(R57 窗口)
HF Daily 8-25 立标池双向锚进入第 14 日(对比 8-24 第 13 日数据):
- EnvHarness 8-25 258▲(HF Daily #1,+4▲ 续立,创 R53 以来的历史新高)——连续第四日极显著,增幅收窄但绝对值新高
- FACET 8-25 115▲(#2,持平)——维持
- SWE-bench Science 8-25 61▲(#4,+3▲ 中等)——延续
- MemTrapBench 8-25 31▲(#9,持平)——维持
- SkillEvo 8-25 30▲(#10,+1▲)——维持
- ForgeWM 8-25 23▲(#13,+1▲)——维持
- OmniAssistBench 8-25 27▲(#12,新晋)——新晋锚
- Beyond Correctness 8-25 19▲(#14,新晋)——新晋锚
- ASI-Bench 8-25 跌出确认——连续第四日跌出,信号中断确认
立标池双向锚第 14 日:EnvHarness 258▲ 锚1 续立极显著但增幅收窄(+4▲ vs +8▲)+ FACET/SWE-bench Science 稳维持 + OmniAssistBench + Beyond Correctness 双新晋锚 + ASI-Bench 衰减确认 = 立标池无结构性新增,但新增两支新锚信号
综合:矛盾与待核实清单
- OmniAssistBench(2608.21360):paper_card ❌ 仍未建(eval 邻接,HF Daily 8-25 #12 27▲ 新晋锚)
- Beyond Correctness(2608.12781):paper_card ❌ 仍未建(eval 邻接,HF Daily 8-25 #14 19▲ 新晋锚)
- AgentDebug(GitHub ulab-uiuc/AgentDebug):paper_card ❌ 仍未建(eval 邻接 ★★★,Jay 工程筛选高价值,17 种错误 × 5 模块两阶段调试)
- Datadog State of AI Engineering 2026(2026-08-25 agent-eval-debugging-production):生产环境 LLM 调用 5% 报错(60% rate limit)+ 840 万次 rate limit/月;eval 邻接 ★★★(第一方生产 trace 数据);建议独立核实
- 41 种失败模式分类学(arXiv:2607.28802):与 AgentDebug(17 种 × 5 模块)是否有重叠或层级关系待核实;Cohen's κ=0.76 需独立 PDF 核验
- ASI-Bench(2608.17271):连续四日跌出 top 15,衰减确认;paper_card ❌ 仍未建(跨轮 R53→R57 遗留)
- ASI-Bench 衰减跌出(2608.17271):连续四日跌出,ASI 超对齐评测信号中断确认;paper_card 仍缺失需归档
- PV-SST(2608.20438):paper_card ❌ 仍未建(eval 邻接,Tom radar 高价值 ★,HF Daily 8-25 votes:2)
- FlavourBench(2608.20574):paper_card ❌ 仍未建(eval 邻接 ★,HF Daily 8-25 votes:2)
- CPI-Bench(2608.14546):paper_card 966 ✅ 已建(evaluation 主分类);主分类 rag vs evaluation 双口径待确认
- Self-Harness(2606.09498):paper_card ❌ 仍未建(eval 邻接 ★★,Jay 高价值 ★★;"最强模型换 harness 提升幅度不如中小模型"反直觉结论待 PDF 验证)
- Reliability Science Framework "memory scaffold 普遍伤害"(2603.29231):P0 反方立基础锚(flyp 8-25 critical-read 已落盘 ★★★);10 模型无一例外 memory-augmented scaffold 伤害长视性能;PDF §4-5 验证截止 9-5
可引用 arXiv 号列表(本次预消化涉及的)
| arXiv ID | 名称 | 状态 | 分类 |
|---|---|---|---|
| 2608.21360 | OmniAssistBench | ❌ paper_card 未建 | eval 邻接 ★(HF Daily 8-25 #12 27▲ 新晋锚) |
| 2608.12781 | Beyond Correctness | ❌ paper_card 未建 | eval 邻接 ★(HF Daily 8-25 #14 19▲ 新晋锚) |
| 2608.20438 | PV-SST / Peer-Voted Stress Tests | ❌ paper_card 未建 | eval 邻接 ★(Tom radar 高价值;HF Daily 8-25) |
| 2608.20574 | FlavourBench | ❌ paper_card 未建 | eval 邻接 ★(HF Daily 8-25 votes:2) |
| 2608.14546 | CPI-Bench | ✅ paper_card 966 已建 | eval 邻接 ★(evaluation 主分类;S2 被引 2) |
| 2606.09498 | Self-Harness | ❌ paper_card 未建 | eval 邻接 ★★(Jay 高价值;反直觉) |
| 2608.01964 | LongHorizon-Harness | ✅ paper_card 713 已建 | eval 邻接 ★★(MEA Loop;Jay 高价值) |
| 2603.29231 | Reliability Science Framework | ✅ 来源追溯 | eval 邻接 ★★★(flyp critical-read 8-25 落盘;P0 反方立基础锚) |
| 2604.11978 | HORIZON | ✅ 来源追溯 | eval 邻接 ★★★(COLM 2026;flyp critical-read 8-25 落盘) |
| 2607.28802 | 41 种 Agent 失败模式分类学 | ❌ paper_card 未建 | eval 邻接 ★★(Jay 8-25 ★★★;评测方法学延革第 18 例预备;Cohen's κ=0.76) |
| 2608.17271 | ASI-Bench | ❌ paper_card 未建 | eval 邻接(衰减跌出确认;连续四日跌出) |
| 2608.21360 | OmniAssistBench | ❌ paper_card 未建 | eval 邻接(HF Daily 27▲ 新晋) |
| 2608.12781 | Beyond Correctness | ❌ paper_card 未建 | eval 邻接(HF Daily 19▲ 新晋) |
| 2607.12227 | Harness-Evolution-Eval-Rethink | ✅ 来源追溯 | eval 邻接 ★★★(flyp critical-read 8-22 落盘) |
| 2608.16590 | Zetta ζ | ✅ paper_card 1027 已建 | eval 邻接 ★★★(HF Daily 142▲;flyp critical-read 8-23) |
| 2608.18565 | SemaPLC | ✅ 已建卡 | eval 邻接 ★★★(HF Daily 115▲;flyp critical-read 8-23) |
| 2608.16859 | HarnessEval-W | ✅ paper_card 992 已建 | eval 专项 ★★★(R55 立基础锚) |
| 2608.15669 | Large Discovery Models | ✅ paper_card 998 已建 | eval 专项 ★★★(R55 立基础锚) |
本轮检查过的来源
| 来源 | 文件 | Evaluation 相关性 |
|---|---|---|
| /shared/research-kb/organized/queue/work-queue.md | 2026-08-25 14:00 | 无 eval 专项净新增 ✓ |
| inbox/tom/HF Daily 2026-08-25 | 8-25 09:00 | EnvHarness 258▲ #1 ✓;FACET 115▲ #2 ✓;OmniAssistBench 27▲ #12 新晋锚 ✓;Beyond Correctness 19▲ #14 新晋锚 ✓;ASI-Bench 衰减确认 ✓ |
| inbox/jay/2026-08-25-agent-eval-debugging-production.md | 8-25 下午 | AgentDebug ★★★(UIUC 17种×5模块错误分类)+ Datadog State of AI Engineering 2026 ★★★(5% 报错,60% rate limit)+ awesome-harness-engineering ★★★★ ✓ |
| inbox/jay/2026-08-25-0510-jay-engineering-articles-secondary-filter.md | 8-25 05:10 | LongHorizon-Harness + Self-Harness + c-CRAB ✓ |
| inbox/flyp/2026-08-25-0507-reliability-science-long-horizon-agents-critical-read.md | 8-25 05:07 | Reliability Science Framework(2603.29231)+ HORIZON(2604.11978)双稿短审稿 ★★★ P0 反方立基础锚 ✓ |
| inbox/flyp/2026-08-25-coding-agents-e1prep.md | 8-25 05:45 | 含 eval 邻接(41 种失败模式 arXiv:2607.28802 + Self-Harness + LongHorizon-Harness)✓ |
| inbox/flyp/2026-08-25-multimodal-e1prep.md | 8-25 09:40 | 含 eval 邻接(CPI-Bench 主分类 evaluation ★ + NARU + TinyCast)✓ |
| inbox/spark/2026-08-25-agent-e1prep.md | 8-25 13:30 | Reliability Science Framework + HORIZON ★★★ + 41 种失败模式分类学 + MCPTox + Gartner eval 平台拐点 ✓ |
| inbox/tom/2026-08-25_agents-lite.md | 8-25 05:06 | AID-Guard + PV-SST + Specification Portability ✓ |
| inbox/tom/2026-08-25-inference-e1prep.md | 8-25 06:10 | 无 eval 专项 ✓ |
| inbox/tom/2026-08-23-evaluation-e1prep.md(R56) | 8-23 15:40 | R56 基线确认(harness 生态六角 + 35 轴 + 23 元组 + 89 件套 + 立标池双向锚第 13 日信号)✓ |
| paper_cards/1063-2608-20438(PV-SST) | agent | ❌ paper_card 未建;eval 邻接 ★ |
| paper_cards/1064-2608-20574(FlavourBench) | evaluation | ❌ paper_card 未建;eval 邻接 ★ |
| paper_cards/1060-2608-21249(Dis2Pat) | evaluation | ✅ paper_card 1060 已建(8-25);eval 邻接 |
| knowledge/evaluation.md R56 | 2026-08-23 15:40 | 确认现有脉络:R56 基线 ✓ |
结论
本轮(E1-R57,2026-08-25)eval 主题 eval 专项 net-new paper_card 0 条(无新建 eval 主分类 paper_card);eval 邻接候选新增 3 条(OmniAssistBench + Beyond Correctness + AgentDebug)。
本轮最重要增量:Jay 8-25 下午工程筛选的 AgentDebug(UIUC ★★★) —— 17 种错误类型 × 5 模块(memory/reflection/planning/action/system)两阶段调试 pipeline,首次系统性提供 Agent 错误归因分类法,填补了"eval 驱动的 debug 方法论"的空白。与 spark 8-25 提到的 41 种失败模式分类学(arXiv:2607.28802,Cohen's κ=0.76)形成互补——前者 17 种 × 5 模块(调试导向),后者 41 种 × 六节点归因(harness bug vs model bug 归因导向)。
立标池结构性变化(R57 第 14 日): - EnvHarness 258▲ 锚1 续立极显著但增幅收窄(+4▲ vs +8▲,连续四日极显著但递减趋势确认,绝对值创历史新高) - FACET 115▲ 维持——harness 生态高位稳定 - OmniAssistBench 27▲ 新晋锚(#12,助手风格交互评测) - Beyond Correctness 19▲ 新晋锚(#14,行为对齐评测) - ASI-Bench 衰减跌出确认(连续四日跌出)——ASI 超对齐评测信号中断确认 - SWE-bench Science 61▲ / MemTrapBench 31▲ / SkillEvo 30▲ / ForgeWM 23▲ 维持——科学软件/memory/演化/video 各方向稳延续
eval 邻接净增 3 条(均为 R56 未覆盖的新候选): - OmniAssistBench(2608.21360,paper_card 未建,HF Daily 8-25 #12 27▲ 新晋锚,助手风格交互评测) - Beyond Correctness(2608.12781,paper_card 未建,HF Daily 8-25 #14 19▲ 新晋锚,行为对齐评测) - AgentDebug(GitHub ulab-uiuc/AgentDebug,paper_card 未建,Jay ★★★,17 种 × 5 模块两阶段调试 pipeline,MIT license + 源码)
eval 邻接延续确认(R56 已覆盖,本轮新增信号): - Reliability Science Framework + HORIZON(flyp critical-read ★★★ P0 反方立基础锚) - 41 种 Agent 失败模式分类学(arXiv:2607.28802,Cohen's κ=0.76,spark 8-25 agent-e1prep) - PV-SST / FlavourBench / CPI-Bench(R56 已覆盖,本轮 paper_card 仍缺失) - Self-Harness / LongHorizon-Harness(R56 已覆盖)
涉及 arXiv 号:2608.21360(❌未建卡/eval邻接★新晋锚)/ 2608.12781(❌未建卡/eval邻接★新晋锚)/ 2603.29231(✅来源追溯/eval邻接★★★P0反方立基础锚)/ 2604.11978(✅来源追溯/eval邻接★★★COLM2026)/ 2607.28802(❌未建卡/eval邻接★★评测方法学延革第18例)/ 2608.20438(❌未建卡/eval邻接★Tom雷达高价值)/ 2608.20574(❌未建卡/eval邻接★HF Daily votes:2)/ 2608.14546(✅已建卡/eval邻接★)/ 2606.09498(❌未建卡/eval邻接★★反直觉)/ 2608.01964(✅已建卡/eval邻接★★)/ 2608.17271(❌未建卡/衰减跌出确认连续四日)
建议后续动作: - [ ] OmniAssistBench(2608.21360)paper_card 新建(eval 邻接,HF Daily 8-25 #12 27▲ 新晋锚) - [ ] Beyond Correctness(2608.12781)paper_card 新建(eval 邻接,HF Daily 8-25 #14 19▲ 新晋锚) - [ ] AgentDebug(GitHub ulab-uiuc/AgentDebug)paper_card 新建(eval 邻接 ★★★,Jay 高价值,MIT license) - [ ] 41 种失败模式分类学(2607.28802)与 AgentDebug 17 种 × 5 模块关系核实(是否互补或重叠) - [ ] ASI-Bench(2608.17271)paper_card 新建(跨轮 R53→R57 遗留,衰减跌出确认但需归档) - [ ] PV-SST(2608.20438)paper_card 新建(eval 邻接 ★,Tom radar 高价值) - [ ] FlavourBench(2608.20574)paper_card 新建(eval 邻接 ★,HF Daily votes:2) - [ ] CPI-Bench(2608.14546)主分类 rag vs evaluation 双口径确认(paper_card 966) - [ ] Self-Harness(2606.09498)paper_card 新建(eval 邻接 ★★,Jay 高价值,反直觉结论待 PDF 验证) - [ ] Reliability Science Framework "memory scaffold 普遍伤害" PDF §4-5 验证(截止 9-5,P0) - [ ] Datadog State of AI Engineering 2026 独立核实(5% 报错 60% rate limit 来源)
Tom · 2026-08-25 15:40 CST · E1 预消化简报 · evaluation 主题 · 0 条 eval 专项 net-new paper_card + 3 条 eval 邻接新候选(OmniAssistBench ★ + Beyond Correctness ★ + AgentDebug ★★★)+ EnvHarness 258▲ 历史新高 + OmniAssistBench + Beyond Correctness 双新晋锚 + ASI-Bench 连续四日衰减跌出确认 + Reliability Science Framework P0 反方立基础锚延续 + 41 种失败模式分类学 ★★ 评测方法学延革第 18 例预备 · 涉及 arXiv:2608.21360(❌未建卡/eval邻接★新晋锚)/ 2608.12781(❌未建卡/eval邻接★新晋锚)/ 2603.29231(✅来源追溯/eval邻接★★★P0反方立基础锚)/ 2604.11978(✅来源追溯/eval邻接★★★COLM2026)/ 2607.28802(❌未建卡/eval邻接★★)/ 2608.20438(❌未建卡/eval邻接★)/ 2608.20574(❌未建卡/eval邻接★)/ 2608.14546(✅已建卡/eval邻接★)/ 2606.09498(❌未建卡/eval邻接★★)/ 2608.01964(✅已建卡/eval邻接★★)/ 2608.17271(❌未建卡/衰减跌出确认连续四日)