Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 从价值观到基准:评估 LLM 在荷兰语政府场景中的应用 — LLM 正日益部署于政府场景,但现有评估框架鲜少同时反映公共行政价值观以及……
- 解码级禁忌:LLM 鲁棒性的诊断压力测试 — LLM 评估通常聚焦于标称条件下的性能,营造出一种能力假象——模型在一条狭窄、高度优化的路径上从容行走……
- 无验证器测试时缩放中的会聚一致性 — 测试时缩放常借助外部验证器(如编程中的编译器与测试用例,或机器人应用中的训练好的价值函数)来获取高质量 rollout。
- 融合训练:面向 LLM 的数学泛化 — 思维模式融合(TMF)通过在单一模型中统一非思维模式与思维模式,使 LLM 能同时支持简洁回复与长链推理……
- RA-FinBERT:面向低资源金融情感分类的规则感知 LoRA 适配 — 金融情感分析将非结构化金融新闻转化为可量化的信号,以辅助市场分析与决策。现有面向资源高效……