Multimodal Model Diffing for Feature Discovery and Control

  • 类型:arxiv
  • 标识:2608.09928
  • 链接:https://arxiv.org/abs/2608.09928
  • 主分类:multimodal
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:MMDiff, a multimodal model-diffing framework that trains multimodal SAEs and turns them into feature-level interfaces for discovering and controlling multimodal behavior, shows that multimodal SAEs can serve not only as interpretability tools, but as mechanisms for auditing, steering, and controlling MLLMs behavior toward safer and more capable generations.
  • 待LLM分类:否
  • 标题中文:多模态模型 Diffing:用于特征发现与控制
  • TLDR中文:MMDiff 是一种多模态 model-diffing 框架,训练多模态 SAE 并将其转化为特征级接口,用于发现和控制多模态行为;研究表明多模态 SAE 不仅可作为可解释性工具,还可作为审计、引导和控制 MLLM 行为的机制,以实现更安全、更具能力的生成。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-17-agent-rag-longcontext-candidates.json
  • [S2 enrich]