Small Language Models as Judges for Rubric-Based Reinforcement Learning

  • 类型:arxiv
  • 标识:2608.30005
  • 链接:https://arxiv.org/abs/2608.30005
  • 主分类:evaluation
  • 形态:method
  • TLDR:Rubric-based reinforcement learning extends RL beyond tasks with exact answers or rule-based verifiers by scoring responses against instance-specific criteria. However, this makes reward computation expensive: training requires repeated rubric judging, often with proprietary APIs or local generative LLM judges with 7B parameters or more. We study whether smaller language models can serve as efficient and reliable rubric-based judges. To make this question measurable, we construct PointRubric and RaR-Science-Static, two pointwise rubric-based evaluation datasets with instance-specific criteria
  • 待LLM分类:否
  • 来源文件
  • /inbox/tom/_candidates/2026-09-04-agent-rag-longcontext-candidates.json