Cool Papers · cs.IR (papers.cool) · RSS 摘要
信源:Cool Papers · cs.IR (papers.cool) · https://papers.cool/arxiv/cs.IR/feed
- RecoReward:推荐引导的多模态描述生成用于推荐 — 多模态大语言模型(MLLMs)可将多模态物品内容转换为结构化描述,作为推荐所用的语义特征。传统仅依赖内容的方法通常会受到内容质量限制,并受困于诸如物品冷启动和可扩展推理等长期挑战。我们提出 RecoReward,一个新颖的两阶段框架,引导多模态大语言模型首先生成候选描述,然后通过奖励模型在多个细粒度维度上对其排序,奖励模型以下游推荐性能作为监督信号。该方法将语义生成与推荐效用对齐,在生成阶段注入推荐信号,而不依赖显式的内容特征。通过在三个公开基准上的实验,我们表明经推荐信号排序的描述优于内容基线和 LLM 基线,取得了 SOTA 准确率。
- 假设驱动的货架生成用于个性化推荐 — 现代推荐界面将内容组织为货架:例如"更多你喜欢的内容"或"为你准备的新发布"等主题行。在生产系统中,这些货架通常由人工策划或由统计模型选取,容易受限于人手配置和静态规则,难以适应实时用户信号。我们提出一种假设驱动的货架生成方法,将货架合成视为受约束的文本生成任务,其中个性化和上下文目标被表述为显式假设,由大语言模型(LLM)解释。基于 Libre–Blackwell 分析,我们的方法在统一框架内说明了生成质量、个性化和货架多样性之间的权衡,可适用于任何以 LLM 为骨干的接口。
- 用于评估对话式音乐推荐中系统响应的 LLM-as-a-Judge — 对话式推荐系统(CRS)旨在实现两个主要目标:推荐相关物品并生成自然语言响应。虽然推荐准确性已被广泛研究,但响应质量的评估仍主要依赖人工或传统指标,需要可扩展且可靠的自动化方法。在本研究中,我们利用 LLM-as-a-Judge 范式来自动评估音乐对话式推荐系统中的回复质量,考察其在多大程度上能反映人类对相关性、自然度和说服力的判断,并分析不同提示策略对其评估可靠性的影响。
- 超越自我知识:在 LLM 的推理与检索间传播不确定性 — 检索增强生成改善了知识密集型问答,但无差别检索可能引入无关证据并造成不必要的计算。我们研究了模型校准不确定性是否可以指导模型决定何时检索以及检索什么……
- MARS:用于复购外卖推荐的多智能体重排序 — 大语言模型(LLMs)正越来越多地用于推荐系统,但目前仍不清楚仅依靠强大的预训练骨干模型可以获得多少性能……