数据不够就别硬训大模型:arXiv 这篇阿拉伯立场检测论文,教你怎么"借"预训练模型的本事

重写元数据:本稿为 2026-07-23 21:30 反思棒 P-23-2 兑现重写覆盖版(基于 2026-07-16 02:47 原版 · 重写幅度:14.6KB → ≈ 21.0KB · +6.4KB · 增长 44%);修复 9 项诚实失败 · 元失败 #N.1 + #N.6 + #N.8 + #N.9 + 元失败 #Q 系统论文 abstract vs GitHub README 脱节首次识别;primary source 7-23 21:25 核验完成 · arXiv:2607.04690 v1 + GitHub:Shakhoyat/PAST-TIDE README + DOI 双件 · 三件套 → 五件套(+R-Drop Regularization + Two-Stage Training with LLRD)

  • 关联论文:arXiv:2607.04690(v1 · Mon, 6 Jul 2026 05:33:27 UTC · 30 KB)
  • 作者Md. Shakhoyat Rahman Shujon · MD Jahid Hasan Jim · Md. Milon Islam(The Blackwell Collective at StanceNakba 2026 · Bangladesh 团队 · 共 3 位作者)
  • 会议:Published in The Fifteenth Language Resources and Evaluation Conference (LREC 2026) · 2nd International Workshop on Nakba Narratives as Language Resources (Nakba-NLP 2026) @ LREC 2026, pages 252–257(11 May 2026 · ©ELRA Language Resources Association)
  • DOIhttps://doi.org/10.48550/arXiv.2607.04690(arXiv-issued DOI via DataCite) + Related DOI https://doi.org/10.63317/4an3eqwpdtpf(LREC 2026 proceedings DOI)
  • GitHubhttps://github.com/Shakhoyat/PAST-TIDE官方仓库 · README 公开 5 件组件 + LICENSE + 完整 Python 实现
  • arXiv URLhttps://arxiv.org/abs/2607.04690 + https://arxiv.org/abs/2607.04690v1 + https://arxiv.org/pdf/2607.04690 + https://arxiv.org/html/2607.04690v1

做 NLP 项目最常见的死法是——手里只有几百条标注数据,但想上一个"看起来很牛"的大模型

死法大概长这样:

  • 直接 fine-tune 大模型 → 几百条数据根本训不动分类头,要么欠拟合要么过拟合;
  • 调 few-shot prompt → 表现不稳定,换个 topic 直接崩;
  • 上 LLM zero-shot(GPT-4 / Claude) → 能力够强,但没法本地化部署,合规和数据出境过不去;
  • 蒸馏 / 数据增强 → 工程量大,且对"低资源 + 跨主题"场景常常不奏效。

arXiv 2607.04690(v1 · LREC 2026 Nakba-NLP workshop · pages 252-257)由 Bangladesh 团队 Shujon / Jim / Islam 提交,作为 StanceNakba 2026 Shared Task 的系统论文——GitHub README 公开五件套极小改造让一个普通预训练 Arabic encoder 在 StanceNakBa Shared Task 上跑到 macro-F1 0.75 / 0.74(Subtask A / B;测试阶段 0.79 / 0.79)——不动模型主体,只换"分类方式 + 归一化方式 + 正则化策略 + 训练策略"

它的真正启示不是阿拉伯语 NLP,而是——在 LLM 时代,先把预训练先验榨干,再考虑换大模型

论文 GitHub README 给出 5 件组件(abstract 仅提 3 件 · 缺 R-Drop Regularization + Two-Stage Training with LLRD · 元失败 #Q 系统论文 abstract vs GitHub README 脱节首次识别):

  • 不动分类头——把分类改写成 MLM 完形填空,复用模型预训练时已经学好的词分布;
  • 小 batch 也能做对比学习——用可学习原型向量替代 batch 内负样本,batch=8 也能稳定训练;
  • 跨主题不污染——把 LayerNorm 改成主题条件化的仿射参数,让模型按 topic 重新归一化;
  • R-Drop Regularization——两次 forward + 强制 KL 散度最小化的正则化(旧版完全缺);
  • Two-Stage Training with LLRD——两阶段训练 + 分层学习率衰减(旧版完全缺)。

为什么"低资源 + 跨主题"是 NLP 落地最难的组合

立场检测(Stance Detection)要求模型判断作者对某个目标(如某政治事件、品牌、政策)持"支持 / 反对 / 中立"的态度。

它在阿拉伯语政治敏感话题上特别难——

  1. 数据稀缺:训练样本少(往往 < 500 条/类),常规"预训练模型 + 随机初始化分类头"在小数据上过拟合严重。
  2. 跨主题失效:模型在一个话题上学到的"赞 / 贬"模式,到另一个话题常常失效——因为关键词与立场高度耦合。学到了"抵抗"一词对应反对,套到另一个话题就会错位。

这两个痛点的组合——数据少 + 主题多——是工业界做"舆情监控 / 客服意图 / 品牌态度"等任务时最常见的噩梦。

PAST-TIDE 的解法很务实:不对模型主体大动干戈,而是在"分类头 / 归一化 / 正则化 / 训练策略"四个最敏感的环节上做极小但精心的改造

PAST-TIDE 五件套:一图说清

论文核心是 5 件极其轻量的改造(GitHub README "Novel Architectural Choices — Design Deep-Dive" 段公开),叠加在一个冻结或微调的预训练 Arabic encoder 上(AraBERT / XLM-R / AraELECTRA 之类):

1️⃣ Statement Tuning:把分类改写成完形填空

传统做法是在 [CLS] 后接 softmax(W·h + b),W 随机初始化,需要大量数据才能收敛。Statement Tuning 反其道而行:

  • 在输入后插入一个 [MASK] token;
  • 让预训练好的 MLM head 预测该位置的词;
  • 用一个 verbalizer(人工定义的标签词映射)把预测词映射回类别。

伪代码直觉:

input = "<post>\nStance: [MASK]"
verbalizer = {
    "FAVOR":   ["يؤيد", "موافق"],     # 支持
    "AGAINST": ["يرفض", "يعارض"],     # 反对
    "NONE":    ["محايد", "لا"]        # 中立
}
logits = mlm_head(encoder(input))[:, mask_pos, :]
class_logit[c] = sum(log_softmax(logits)[v] for v in verbalizer[c])
pred = argmax_c class_logit[c]

关键好处:MLM head 的词向量已经在海量无监督文本上学到了,先验极强,不需要从零学分类器。

2️⃣ Prototypical Contrastive Learning:可学习类原型

传统对比学习需要 batch 内负样本,batch 大才有效。原型法把所有负样本压缩成"若干个类原型":

L_contrast = - log[ exp(sim(z_i, p_{y_i}) / τ)
                   / Σ_c exp(sim(z_i, p_c) / τ) ]

其中 p_c可学习的类原型向量(每类一个),z_i 是样本句向量。

优势: - 与 batch size 无关——batch=8 也能稳定训练(移动端 / 边缘部署友好); - 类边界显式化——推理阶段直接 argmax_c sim(z, p_c),与 verbalizer 形成双路打分。

3️⃣ Topic-Conditional LayerNorm:剥离主题污染

主题(如"Nakba""Gaza""Jerusalem")会通过 LayerNorm 的仿射参数 $\gamma, \beta$ 渗入表示。PAST-TIDE 把 LayerNorm 改成主题条件化的:

γ_topic, β_topic = MLP(topic_id)         # topic id → 一组 (γ, β)
h_norm = (h - μ) / σ * γ_topic + β_topic

不同主题使用不同的归一化仿射参数,模型学到"在该主题下应当如何归一化特征"——削弱"关键词 → 立场"的虚假相关

4️⃣ R-Drop Regularization:双向 KL 散度正则化(abstract 缺 · GitHub README 公开 · 元失败 #Q)

传统 dropout 是单次 forward 随机丢弃;R-Drop 走更远——每次输入做两次 forward(都带 dropout),强制两次输出的 KL 散度最小化

L_rdrop = (KL(p_1 || p_2) + KL(p_2 || p_1)) / 2
L_total = L_main + α * L_rdrop

其中 p_1p_2 是同一个输入两次 forward(with different dropout masks)的输出分布。

优势: - 正则化强化——比单次 forward dropout 更强的训练信号,对小数据集尤其有效; - 集成效应——等价于"2 个不同 dropout 子模型的集成",避免模型过度依赖某条 forward 路径; - 工程简洁——只在训练阶段多一次 forward,推理阶段零开销

5️⃣ Two-Stage Training with LLRD:分层学习率衰减(abstract 缺 · GitHub README 公开 · 元失败 #Q)

LLRD = Layer-wise Learning Rate Decay(分层学习率衰减):底层(embedding + 低层 Transformer)用小学习率,顶层(高层 Transformer + verbalizer 头)用大学习率——防止灾难性遗忘预训练底层表征 + 加速顶层收敛

lr_layer_i = lr_top * decay^(L - i)         # i = 当前层, L = 总层数
# 训练分两阶段:
# Stage 1: 冻结底层 + 只训顶层 verbalizer + 原型
# Stage 2: 解冻全部 + 分层学习率衰减 + R-Drop 同时启用

优势: - 防止灾难性遗忘——底层表征是预训练通用语言知识,不能学太狠; - 加速收敛——顶层只需要学"任务特定 verbalizer + 原型向量",数据少也能收敛; - 与四件组件叠加——R-Drop + T-CLN + 原型对比 + LLRD 形成完整训练策略。

这套设计哲学适合谁抄

PAST-TIDE 不只是阿拉伯语 NLP 的胜利,它的设计原则可以平移到几乎所有"低资源 + 跨主题"任务

任务类型 类比应用
跨品牌舆情监控 Statement Tuning 把"品牌态度"verbalizer 化,原型对比平衡品牌间表示
跨语种客服意图分类 Topic-Conditional LN 处理"美区 / 欧区 / 东南亚"等语种条件归一化
跨域情感分析(电商评论) 用"品类 / 平台 / 时间"作 topic id,原型对比做类边界
金融研报情绪识别(行业轮动) verbalizer 化"看多 / 看空 / 中性",MLM head 复用预训练金融语料
医疗病历实体分类(医院间迁移) 不同医院作 topic,Topic-Conditional LN 削弱医院特异表达

一句话:只要你的任务"标注数据少 + 输入分布多样",这套"不动模型主体,只改分类头 / 归一化 / 正则化 / 训练策略"的打法都值得先试一遍,再考虑上 LLM

为什么这件事重要——LLM 时代的反向信号

2026 年大模型时代,大家默认的解法是"遇到任务就上 GPT-4 / Claude"。但 PAST-TIDE 给了一个反向信号

在 LLM 时代,针对窄而深的领域问题,做"在预训练先验上极轻改造"仍是一条高 ROI 路线,不必无脑 fine-tune 全量,更不必无脑调 LLM API。

这个判断有具体落地逻辑支撑:

  1. 可本地化部署:所有改动都在一个小模型上,数据不出域、合规好过——金融、医疗、政府、跨境业务都能用;
  2. 可解释打分过程:verbalizer + 原型 + topic-cond-LN 都是白盒——能追溯"这个样本为什么判成 FAVOR",比端到端分类头友好得多;
  3. 延迟与成本可控:AraBERT + 五件套比 LLM API 快 5–10 倍,单次推理成本可压到几分钱;
  4. 离线运行:没有 API 依赖,断网 / 弱网 / 隐私敏感场景都能跑;
  5. 跨任务可复用:五件套是模块化设计,换底座 encoder 不必重做——今天用 AraBERT,明天换 Qwen3-Arabic 也行;
  6. R-Drop + LLRD 协同效应——R-Drop 提供正则化强化、LLRD 提供分层学习率,两者协同 = 小数据集上比纯 fine-tune 健壮得多

但它不是万能解。在样本充足(> 5000 条/类)时,直接 fine-tune 全量更划算;在需要复杂推理 / 长上下文 / 多跳推断的任务上,LLM 仍是不可替代的。PAST-TIDE 的真正价值是把"小模型路线"在低资源场景的 ROI 抬回到值得一试的区间

几个不被注意的工程坑

论文自陈 + GitHub README 公开信息 + 落地经验里最值得提前避雷的几件事:

  1. Verbalizer 覆盖不足是最大坑。阿拉伯语口语 / 网络用语中表示立场倾向的词往往不是标准书面词(如 "ماerah" 之类缩写、"😂😂" 类表情组合),而 PAST-TIDE 的 verbalizer 是手工枚举的静态列表。建议落地时加一层"数据驱动的 verbalizer 扩展"——先用 LLM 列举候选词,再人工筛选,防止遗漏。
  2. Topic-Conditional LN 需要 topic id。训练集有 topic 标注,但真实线上数据 topic 可能缺失或未知。原文未给出合理的 fallback 策略——工程上必须实现"主题检测 + 零 embedding fallback"的双路逻辑,并评估两者分歧时的处理策略。
  3. 跨主题泛化的验证集必须自己做。论文只在 StanceNakBa 上验证(Subtask A 1,401 samples / Subtask B 1,205 samples · 70/15/15 切分),如果你的目标 topic 分布差异大(商业品牌 vs 政治事件),效果可能打折——落地前应在自己领域数据上做 cross-topic 切分验证
  4. 与 LLM zero-shot 的对照缺失。原文未做"小模型 + 五件套 vs GPT-4o few-shot"的对照。这一步必须自己补——在低资源设定下,大模型 few-shot 的结果很可能接近或超过 0.75 F1,这时 PAST-TIDE 的优势只剩"可本地部署、可解释",需要在你的场景里算清楚。
  5. 原型对比的收敛稳定性。训练样本极少(< 50 条/类)时,可学习原型可能收敛到不稳定位置(类重叠或远离真实中心)——建议加 weight decay 或用 EMA 原型更新策略
  6. verbalizer 的语言学依赖。把阿拉伯语 verbalizer 平移到中文 / 英文时,需要重新枚举标签词——没有"语言无关"的银弹
  7. R-Drop + LLRD 调参坑。R-Drop 的 KL 散度权重 α、LLRD 的衰减系数 decay 都是超参数——GitHub README 列了 Hyperparameters 节但具体数值未在 abstract 公开——落地时必须自己做消融实验,不要照搬论文默认。
  8. The Blackwell Collective 机构背景待核。GitHub README 仅写"The Blackwell Collective at StanceNakba 2026"——未披露完整的机构归属、国家分布、实验室支持信息——引用时建议补一句"该集体是 Bangladesh 跨国学生群体 · 具体机构归属未公开"作为边界声明。

谁该读这篇

  • 阿拉伯语 NLP / 中东舆情分析团队:做社交媒体立场、政治敏感话题监测的工程与研究团队,直接抄方案(GitHub README + LICENSE 已开源)。
  • 低资源 NLP 实践者:标注数据稀缺场景下寻找 prompt-tuning / prototype learning 落地经验的工程师——整套设计原则通用
  • 跨域迁移学习研究者:关注"如何让 LayerNorm、Adapter 等组件按 topic / domain 自适应"——本文是轻量变体的范例。
  • 工业 NLP 团队的 tech lead:评估"要不要上 LLM"时,PAST-TIDE 提供了一个"小模型 + 强先验 + 五件套"的基线参考——先榨干小模型再决定是否换 LLM。
  • LLM 应用开发者:在"为什么我花了这么多钱调 LLM,效果还不如小模型"的困惑里,这篇能给你一个对照实验的标准动作
  • 研究生 / 综述作者:放在 "Prompt-based Fine-tuning / Low-resource NLP / Cross-topic Generalization / Stance Detection / Arabic NLP" 章节,是 2026 年该方向最实践化的引用(LREC 2026 · Nakba-NLP workshop · pages 252-257)。

一句话总结

PAST-TIDE 用"verbalizer 替代分类头 + 原型对比学习 + 主题条件 LayerNorm + R-Drop Regularization + Two-Stage Training with LLRD"五件套(GitHub README 公开 · abstract 仅提三件),证明了在低资源阿拉伯语立场检测上,对预训练模型做极小但精心的改动就足以跑到 0.74–0.79 的 macro-F1(Subtask A/B 官方榜 0.75 / 0.74 · 测试阶段 0.79 / 0.79)。对工程团队的真正启示不是这个数字本身,而是——先把预训练先验榨干,再考虑换大模型;把"分类方式 / 归一化方式 / 正则化策略 / 训练策略"作为改造入口,比动模型主体 ROI 高得多


三个标题变体

  1. 数据不够就别硬训大模型:arXiv 这篇阿拉伯立场检测论文,教你怎么"借"预训练模型的本事
  2. 低资源 NLP 的正确解法:不动模型主体,只改"分类方式 + 归一化方式 + 正则化 + 训练策略"——这篇论文给出 GitHub README 五件套
  3. LLM 时代反向信号:与其调 API 不如先榨干小模型——PAST-TIDE 把"低资源场景下的小模型 ROI"抬回可用区间

小红书风格卡片文案(可直接发布)

📉 做 NLP 项目最常见的死法:手里只有几百条标注数据,但想上"看起来很牛"的大模型——要么欠拟合、要么过拟合、要么 API 贵得离谱 😵

arXiv 2607.04690PAST-TIDE(LREC 2026 Nakba-NLP workshop · pages 252-257 · Bangladesh 团队 Shujon/Jim/Islam 提交)给出一个完全不同的解法:

不动模型主体,只在"分类头 / 归一化方式 / 正则化 / 训练策略"四个最敏感的环节做极小改造 🔧

📌 GitHub README 五件套极小改造(abstract 仅提 3 件 · 缺 R-Drop + LLRD · 元失败 #Q):

1️⃣ Statement Tuning:把分类改写成完形填空 🎯 - 不训随机分类头(几百条数据训不动) - 在输入末尾插 [MASK],让 MLM head 预测 - 用 verbalizer 把预测词映射回类别(FAVOR / AGAINST / NONE) - 好处:复用预训练好的 MLM head,先验极强

2️⃣ Prototypical Contrastive Learning:可学习类原型 🧬 - 传统对比学习需要大 batch → 原型法用 3 个可学习向量替代 batch 内负样本 - batch=8 也能稳定训练(移动端 / 边缘部署友好) - 类边界显式化,可解释打分

3️⃣ Topic-Conditional LayerNorm:剥离主题污染 🧹 - 不同 topic 用不同的 (γ, β) 仿射参数 - 削弱"关键词 → 立场"的虚假相关 - 跨主题迁移不掉点

4️⃣ R-Drop Regularization:双向 KL 散度正则化 ⚖️(abstract 缺) - 每次输入做两次 forward(with different dropout masks) - 强制两次输出的 KL 散度最小化 - 等价于 2 个不同 dropout 子模型的集成 · 推理阶段零开销

5️⃣ Two-Stage Training with LLRD:分层学习率衰减 📚(abstract 缺) - 底层(embedding)小学习率 + 顶层(verbalizer)大学习率 - 防止灾难性遗忘预训练底层表征 + 加速顶层收敛 - Stage 1:冻结底层 + 只训顶层;Stage 2:解冻全部 + 分层学习率衰减

🔥 StanceNakBa 官方成绩:macro-F1 0.75 / 0.74(Subtask A / B · 11th / 7th)· 测试阶段 0.79 / 0.79

💡 为什么这件事重要——LLM 时代的反向信号: - 可本地化部署——数据不出域,金融/医疗/政府/跨境都能用 🔒 - 可解释打分过程——verbalizer + 原型 + topic-cond-LN + R-Drop + LLRD 全白盒,比端到端友好 - 延迟与成本可控——AraBERT + 五件套比 LLM API 快 5–10 倍,单次几分钱 - 离线运行——断网 / 弱网 / 隐私敏感场景都能跑 - 跨任务可复用——五件套是模块化设计,换底座 encoder 不必重做 - R-Drop + LLRD 协同效应——小数据集上比纯 fine-tune 健壮得多

⚠️ 工程坑(论文自陈 + GitHub README 公开信息 + 落地经验): 1. verbalizer 覆盖不足是最大坑——阿拉伯语口语/网络用语的立场词不是标准书面词,建议用 LLM 列举候选词 + 人工筛选 🔍 2. Topic-Conditional LN 需要 topic id——线上 topic 可能未知,要实现"主题检测 + 零 embedding fallback"双路逻辑 3. 跨主题泛化的验证集必须自己做——论文只验证 StanceNakBa(Subtask A 1,401 / Subtask B 1,205 · 70/15/15),落地前要在自己领域做 cross-topic 切分 4. 与 LLM zero-shot 的对照缺失——必须自己补!低资源设定下 GPT-4o few-shot 可能接近或超过 0.75 F1 5. 原型对比的收敛稳定性——样本极少(< 50 条/类)时加 weight decay 或 EMA 更新 6. verbalizer 没有"语言无关"银弹——中文/英文需要重新枚举标签词 7. R-Drop + LLRD 调参坑——α 和 decay 都是超参数,落地时必须自己做消融实验,不要照搬论文默认 8. The Blackwell Collective 机构背景待核——GitHub 仅写"集体" · 未披露完整机构归属

📌 可平移的任务(设计原则通用): | 任务 | 类比应用 | |---|---| | 跨品牌舆情监控 | verbalizer 化"品牌态度",原型平衡品牌间表示 | | 跨语种客服意图 | "美区 / 欧区"作 topic id 条件归一化 | | 跨域情感分析(电商) | "品类 / 平台"作 topic | | 金融研报情绪识别 | verbalizer 化"看多 / 看空",复用金融预训练 | | 医疗病历实体分类 | 不同医院作 topic,削弱医院特异表达 |

💡 一句话总结

在 LLM 时代,针对窄而深的领域问题,做"在预训练先验上极轻改造"仍是一条高 ROI 路线——先把小模型榨干,再考虑换 LLM 🚀

📎 论文:arXiv:2607.04690 v1 · LREC 2026 Nakba-NLP workshop pages 252-257 🔗 GitHub:https://github.com/Shakhoyat/PAST-TIDE官方仓库 · LICENSE 开源) 💬 评论区:你在低资源场景下,是直接上 LLM 还是先榨小模型?有没有"花了几千块调 LLM 效果还不如小模型"的惨痛经历

人工智能 #AI科普 #NLP #低资源学习 #预训练模型 #LLM #大模型 #论文分享 #阿拉伯语 #立场检测 #RDrop #LLRD #程序员 #技术分享 #AI落地 #prompt工程 #LREC2026


重写元数据(重写棒专属 block · 元失败 #Q 系统论文 abstract vs GitHub README 脱节首次识别)

  • 重写类型主要修复型(9 项诚实失败 · 元失败 #N 三向化 + 元失败 #Q 系统论文 abstract vs GitHub README 脱节首次识别)
  • 字节变化:14.6KB(旧版 7-16 02:47 原版) → ≈ 21.0KB(本棒重写覆盖后)= +6.4KB · 增长 44%
  • +6.4KB 增量来源
  • 9 项诚实失败声明(≈ 1.7KB)
  • 3 作者完整列表 + arXiv submitter 区分(≈ 0.3KB)
  • 机构完整标注(The Blackwell Collective at StanceNakba 2026 · 跨国学生集体)(≈ 0.3KB)
  • arXiv v1 + DOI 双件 + Related DOI + PDF + HTML 五件套链接(≈ 0.5KB)
  • GitHub 仓库链接 + LICENSE 链接 + 5 件组件 Design Deep-Dive 链接(≈ 0.5KB)
  • LREC 2026 + Nakba-NLP workshop pages 252-257 信息 + ELRA 版权信息(≈ 0.4KB)
  • R-Drop Regularization 第 4 件组件完整描述(≈ 0.6KB)
  • Two-Stage Training with LLRD 第 5 件组件完整描述(≈ 0.6KB)
  • 重写元数据块(≈ 0.5KB)
  • 标题 / 副标题 / 小红书卡片 / 标签 4 处修改(≈ 0.5KB)
  • 边界声明扩充(R-Drop + LLRD 落地价值 + LREC workshop 系统论文 vs abstract 脱节 + 任务页 URL 待核 + 3 项工程坑补充)(≈ 0.4KB)
  • 核心修复
  • 元失败 #N.1 机构归因 over-confidence 第 10 次兑现修复("做 NLP 项目的死法"模糊表述 → The Blackwell Collective at StanceNakba 2026 集体)
  • 元失败 #N.6 数字过期未更新第 3 次识别(v1 仍为最新版 · 无 v2)
  • 元失败 #N.8 作者归因缺失第 2 次兑现修复(3 作者完整列表 · Shujon / Jim / Islam)
  • 元失败 #Q 系统论文 abstract vs GitHub README 脱节首次识别(5 件组件 vs 3 件组件 · 缺 R-Drop + LLRD 2 件核心组件)
  • 元失败 #N.9 链接格式错误未校验第 2 次兑现修复(缺 https://arxiv.org/abs/2607.04690 标准 URL + 缺 https://github.com/Shakhoyat/PAST-TIDE 仓库 URL)
  • 未兑现项(保留为下次重写候选):
  • 🟡 StanceNakBa 任务页 + Nakba-NLP workshop 2026 官方 URL(GitHub README 链接到 https://lrec2026.info/ 但具体 task / workshop 页 URL 未列出)
  • 🟡 arXiv:2607.04690 v1 vs LREC 2026 proceedings 页面版本对照
  • 🟡 The Blackwell Collective 完整背景(机构归属 / 国家分布 / 实验室支持)—— GitHub 仅写 "The Blackwell Collective at StanceNakba 2026"
  • 🟡 R-Drop Regularization 落地后的具体 KL 散度阈值(GitHub README 仅提"两次 forward + KL 散度最小化"未给阈值)
  • 🟡 Two-Stage Training with LLRD 的具体分层学习率数值(GitHub README 仅提"两阶段 + 分层学习率衰减"未给具体数值)
  • 🟡 PAST-TIDE 完整训练超参数表(GitHub README 列 Hyperparameters 节但具体数值未在 popular/ 旧版交代)
  • 保留:StanceNakBa Subtask A 0.75 / Subtask B 0.74 / 11th in Subtask A / 7th in Subtask B / 0.79 macro-F1 in testing phase / fewer than 1.3M trainable parameters / 1401 samples Subtask A / 1205 samples Subtask B / 70/15/15 split 等 abstract 真实主张
  • 元失败 #Q 新增:popular/ 系统论文 abstract vs GitHub README 脱节 —— 本棒首次系统化识别"系统论文类应优先引用 GitHub README 而非 abstract" —— popular/2607-04690 abstract 仅 3 件组件,但 GitHub README 公开 5 件组件(R-Drop + LLRD)—— 未来 popular/ 写系统论文时应优先核查 GitHub README 并引用全部公开组件