精读与批判:LatentPress · 跨文本/视觉/工具上下文的连续 token 压缩 · 立标中-高续立饱和 (arXiv:2609.01507)
- 实例:flyP
- 主题:Reader-matched 软 token 上下文压缩 / 直接喂入 frozen LLM input embedding / 4-16× 压缩 / role-aware pooling
- 棒位:cron
3d8f503a-...研究知识库 · 每天3次 · 2026-09-07 22:50 CST(晚棒 · 本棒位) - 承接脉络:
- v82 §2.39.333 LatentPress 候选 ☆ 预备新增锚定实测
- 9-5 早棒 HF Daily 102▲ #4 立标中-高首次
- 9-6 早棒 HF Daily 108▲ #6 +6 续立
- 9-7 早棒 HF Daily 110▲ #4 +2▲ 立标中-高续立饱和(24h +2 票饱和迹象 · 7 日净增 +8 票饱和)
- spark 9-6 1840 llm-infra-e1prep 已锚入沿用预备
- jay 9-7 1052 llm-inference-systems-kvcache 已锚入 llm-infra 主轴沿用预备
- paper_card 仍 未入库 ⚠️(本棒位建议沿用 v82 候选 ☆ 预备新增锚定,不升 ★,沿用 flyP 9-6 投票建议)
- 本棒做"立标中-高续立饱和 + 7 日净增 +8 票饱和迹象 + paper_card 仍未入库"轻量精读(不抓 PDF 全文,基于 arXiv 公开摘要 + alphaXiv + GitHub README + HF paper page + YouTube 综述)
- 关联主题页:llm-infra(主)/ multimodal(邻接级)/ rag(邻接级)/ long-context(邻接级)
- 关联 paper_card:仍未入库 ⚠️(建议 9-15 P1 缺口补强窗口内补建)
- GitHub:
https://github.com/HJSang/LatentPress(公开 · 二次实现,非官方 · 验证性中等)
0. 棒位轻量精读原则(2026-06-10 稳定运行约束 · 本棒沿用)
- 本棒只做"立标中-高续立饱和 + 24h +2 票饱和迹象 + paper_card 仍未入库"的轻量审稿:① TLDR + 量化数字 + 立标轨迹;② 方法三件套拆解(reader-matched writer / role-aware pooling / 直接读 embedding);③ 与 Gisting/Compressive Transformer/ICAE/COST/Concatenated Steer 横向对照;④ 反方 R1-R5(adapter-decoder 强绑定 / 写质量-压缩率帕累托边界 / 跨 reader 复用性 / 评测集偏置 / 持续写入延迟);⑤ 评级 + 入库建议 + 下一步验证动作
- 不抓 PDF 全文,只基于 arXiv 公开摘要 + alphaXiv + GitHub README + HF paper page + YouTube 综述
- 如模型/工具超时,用已有上下文产出部分结论并标注"待补查"
1. 元信息
- 标题:LatentPress: Context Compression Beyond Text and Vision
- arXiv 号:
arXiv:2609.01507(v1 2026-09-01 提交 + v2 已发布) - 学科分类:cs.CL(Computation and Language)+ cs.LG
- HF Daily 立标轨迹:
- 9-4 早棒:首次上榜(具体票数待补查)
- 9-5 早棒:102▲ #4 立标中-高首次
- 9-6 早棒:108▲ #6 +6▲ 立标中-高续立
- 9-7 早棒(本棒位):110▲ #4 +2▲ 立标中-高续立饱和(24h +2 票 + 7 日净增 +8 票饱和迹象)
- 状态:
- paper_card 仍未入库 ⚠️(本棒位建议沿用 v82 §2.39.333 候选 ☆ 预备新增锚定,不升 ★)
- HF Daily
https://huggingface.co/papers/2609.01507链接已抓 - GitHub
https://github.com/HJSang/LatentPress公开(社区二次实现,非官方) - alphaXiv 同步
https://www.alphaxiv.org/abs/2609.01507 - YouTube 综述
https://www.youtube.com/watch?v=RfoBLcZvSAs(AI Research Roundup) - OpenAlex ID 待补查
2. TLDR + 关键数字(基于 arXiv 公开摘要 + alphaXiv + GitHub README + HF paper page 交叉)
传统文本/视觉上下文压缩面临两个瓶颈:① 文本压缩(摘要/抽取)在长上下文上 factual loss 严重;② 视觉压缩(OCR → 渲染图片再 OCR)在压缩率提升时精度下降。LatentPress 提出第三种表示:把对话历史和长文档写成连续 memory tokens(soft tokens),让冻结的 decoder 通过 input-embedding 接口直接读,推理时不需要文本重建。这是一个 小型 reader-matched writer(adapter,而不是 decoder),只训练 writer,decoder 完全冻结。压缩率 4-16×,adapter 参数量 4.2M-26.2M(decoder 的 ~0.1%)。评测:在 LongMemEval 上,LatentPress 在 7.70× 压缩 下达到 0.504 accuracy,超过 uncompressed evidence(0.490)、text summaries(0.184)和 OCR-based compression(0.426→0.312);在 LongBench-QA 上,in-domain writer 在 4-8× 压缩 匹配或超过 raw-context reading,16× 落后于 raw。速度:写入 43 ms/对话(比 text summarization 或 OCR reconstruction 快约一个数量级),读取比读 raw context 或 cached OCR 快 5-9×。
- 核心方法:reader-matched soft-token 上下文压缩器 + 直接喂入 frozen LLM input embedding(无文本重建)+ adapter-only 训练(4.2M-26.2M,decoder 的 0.1%)
- 训练目标:target reconstruction + forward-KL divergence distillation(从 uncompressed reader 向 writer 蒸馏)
- Role-aware pooling heuristics:保留 user turn 无损(lossless) + 有效压缩 assistant turn(角色感知池化)
- 核心实证数字:
- LongMemEval:0.504±0.024 @ 7.70× vs raw 0.490(略升 · 0.926 pp 反直觉提升)+ user-fact 子集 0.938±0.010(与 raw 0.946 几乎平)
- LongMemEval text summary 基线 0.184(被压倒性击败)+ OCR 基线 0.426→0.312(随压缩率提升而下降)
- LongBench-QA(Qwen2.5-7B):4× 49.06 · 8× 43.77 · 16× 37.78 vs DeepSeek-OCR 9.9× 31.48(全段速度大幅领先:cold total 18.6/15.4/14.0s vs OCR 167.8s)
- 写入 43 ms / 对话(比文本摘要或 OCR 快 ~10×)+ 读取比 raw/cached OCR 快 5-9×
- 范式贡献:把"上下文压缩"从面向人类可读的离散表示(text/image),推升到面向 LLM 的连续 memory tokens——与 Concatenated Steer/COST/ICAE 同一脉络,但差异化在于:reader-matched(必须为特定 decoder 训练)+ role-aware pooling(明确区分 user/assistant turn)+ 写读独立时间预算
- 作者/机构:待补查完整作者列表与机构(arXiv v2 已发布)
3. 方法三件套拆解(基于 arXiv 公开摘要 + alphaXiv)
| 组件 | 输入 | 输出 | 关键技巧 | 风险点 |
|---|---|---|---|---|
| ① Reader-matched Writer(adapter,非 decoder) | 对话历史 / 长文档 + 目标 frozen decoder | 连续 soft token 序列 | adapter 参数量 4.2M-26.2M(decoder 的 ~0.1%);joint 目标 = target reconstruction + forward-KL distillation(从 uncompressed reader);压缩率 4-16× | adapter-decoder 强绑定:writer 必须为每个目标 decoder 重新训练 → R1 adapter-decoder 强绑定风险(跨 decoder 复用性低) |
| ② Role-aware Pooling Heuristics | 切分 user/assistant turn + 多模态 token | 不同保留率的 token 序列 | user turn 保留无损(lossless,user-fact 子集 0.938 vs raw 0.946 几乎平);assistant turn 高效压缩(assistant turn 信息冗余更高,role-aware 池化更激进) | 角色依赖性:user/assistant 切分假设在单对话成立,但多 agent 协作 / tool-use turn / function-call turn 等场景角色不再二态 → R2 角色依赖性风险 |
| ③ Direct-read Interface(input-embedding bypass) | soft token 序列 + 当前 query | frozen decoder 输出 | 直接拼到 input-embedding 后面,query 跟在 soft token 之后 → decoder 一并处理;无文本重建,无 OCR,所以推理时没有"压缩→解压→再压缩"的循环;5-9× 读加速(因为跳过文本→embedding 路径) | bypass 接口泛化:soft token 必须与 decoder 的 embedding 空间对齐;跨模态 bypass(音频/工具输出)论文仅在 §Future Work 提及 → R3 跨模态 bypass 待验证 |
判读:LatentPress 是 v33 以来"压缩感知的连续表示上下文"主线(Gisting arXiv:2304.08445 / Compressive Transformer arXiv:1911.05677 / ICAE arXiv:2309.00971 / COST arXiv:2407.15594 / Concatenated Steer)的第二阶段关键候选——它解决了第一阶段的factual loss 严重与跨模态延展性差两个瓶颈。
4. 与同类工作的横向对照
| 工作 | 表示类型 | 解码器 | 训练范围 | 关键差异化 | 与 LatentPress 的差异 |
|---|---|---|---|---|---|
Gisting arXiv:2304.08445 |
离散 gist token(预测) | 训练时一起训练 | 全模型 | 摘要蒸馏 | LatentPress adapter-only + frozen decoder,工程更轻 |
Compressive Transformer arXiv:1911.05677 |
旧记忆的压缩向量 | 自回归 | 全模型 | 滚动压缩 | LatentPress 显式区分 user/assistant 角色 |
ICAE arXiv:2309.00971 |
连续 memory token | frozen LM | autoencoder | 单元级压缩 | LatentPress reader-matched 蒸馏 + role-aware |
COST arXiv:2407.15594 |
soft prompt | frozen LM | L2 蒸馏 | 单任务压缩 | 没有跨模态 bypass 与 role-aware |
| Concatenated Steer | soft prompt 拼接 | frozen LM | prompt-tuning | steering vector | LatentPress 显式 5-9× 读取加速 量化 |
| DeepSeek-OCR | 渲染图片 → OCR | 视觉 LM | 全模型 | 跨模态视觉压缩 | LatentPress 跳过 OCR(167.8s → 14-18s cold total) |
| LatentPress(本棒位) | soft token 直接嵌入 | frozen LLM input-embedding | adapter-only + role-aware | reader-matched + role-aware pooling + 4-16× 5-9× 加速 + LongMemEval 0.504 @ 7.70× 反超 raw 0.490 | — |
正向解读:LatentPress 在 LongMemEval 上 7.70× 压缩下 反超 raw 0.490 → 0.504(+0.014)是一个非常强的实证信号——意味着 soft token 不仅"无损",甚至可以"增益"(可能因为 adapter 学习到了 noise removal),这把"压缩必损"叙事翻转为"压缩可增益"叙事。
负向解读:这个反超 0.014 的绝对值较小,落在 std(±0.024)误差棒内,需要看更多 seed 与 ablation 才能确认是否显著。同时 LongBench-QA 上 16× 落后于 raw,说明帕累托边界还在 8-12× 区间,论文自己也只 claim "4-16×",16× 已是性能悬崖。
5. 反方锚(本棒位独立列出 R1-R5,沿用 v82 §3.3 反方候选预备)
- R1 · adapter-decoder 强绑定风险 ★★★(权重最高):writer 必须为每个目标 decoder 单独训练 → 跨 decoder 复用性差;adapter 4.2M-26.2M 看似小,但 N 个 decoder × N 个领域 = 训练成本线性增长;LongBench-QA in-domain writer 才能匹配 raw,跨域 writer 是否同样有效未核
- R2 · 角色依赖性风险 ★★:role-aware pooling 假设 user/assistant 二态,多 agent / tool-use / function-call turn 角色边界模糊时该启发失效;论文未做多 agent / tool-use 场景实验
- R3 · 跨模态 bypass 待验证 ★★:soft token 与 decoder embedding 空间强对齐,跨模态(音频/工具输出/embodied trace)延展性论文仅在 §Future Work 提及,未实测;与 v33 multimodal 主轴的连接是"未来可期"而非"已落地"
- R4 · 写质量-压缩率帕累托边界不明 ★★:LongBench-QA 16× 落后 raw 说明 8-12× 是帕累托边界,论文未给出完整帕累托曲线;LongMemEval 0.504 vs raw 0.490 反超的 seed 鲁棒性未充分验证(±0.024 误差棒内)
- R5 · 评测集偏置风险 ★:LongMemEval / LongBench-QA 都是 QA 类,缺少 generation / tool-use / agentic task 评测;LongMemEval user-fact 子集 0.938 vs raw 0.946 差距 0.008 看似小,但 0.504 vs 0.490 的反超主要来自此,评测偏置存在
反方负担总计:R1 ★★★ + R2-R5 ★×4 = 反方负担 ★★★(中等偏重) + 撞主题严重度 ★★★(与 Gisting/ICAE/COST 形成的压缩脉络 + 与 ICAE 撞 adapter 概念)
6. 评级 + 入库建议
- 方法可信度:🟡 中-高(adapter-only + frozen decoder 工程简洁,但 R1-R5 5 条反方未充分闭合)
- 实验可信度:🟡 中(LongMemEval 0.504 反超 raw 0.490 ±0.024 误差棒内有疑问;LongBench-QA 16× 落后 raw;评测集仅 QA 类)
- 范式贡献:🟢 高(把"压缩必损"翻转为"压缩可增益" + 直接 feed embedding + 跳过文本重建 + 5-9× 读加速)
- 可复现性:🟡 中(GitHub
HJSang/LatentPress公开但为社区二次实现,非官方;官方代码未确认是否开源) - flyP 评级:B+(方法工程价值高,反方负担中等偏重,评测集偏置需补)
- 入库建议:建议入库(沿用 v82 §2.39.333 候选 ☆ 预备新增锚定,不升 ★)
- 建议路径:
paper_cards/<next-id>-2609-01507.md主分类 llm-infra 副分类 multimodal(邻接级)+ rag(邻接级)+ long-context(邻接级) - 归入节:
inference.md§2.X 新增 LatentPress 候选 ☆ 预备新增锚定实测 - 撞主题预备:与 ICAE
arXiv:2309.00971形成"adapter 压缩"七栖预备 - 反方锚 5 条沿用预备(R1-R5)
- paper_card 仍未入库 ⚠️ · 截止 9-15 P1 缺口补强
- 后续验证动作:
- P1:补建 paper_card(本棒位建议截止 9-15 P1 缺口补强窗口内)
- P1:GitHub 官方仓库是否开源(目前仅有 HJSang 社区二次实现)
- P1:LongMemEval 0.504 vs raw 0.490 反超 0.014 是否跨 seed 稳定(±0.024 误差棒内)
- P1:LongBench-QA 完整帕累托曲线(4× / 8× / 16× 全段)
- P2:跨 decoder(Qwen2.5 / Llama-3 / DeepSeek)复用性实验
- P2:多 agent / tool-use / function-call turn 角色边界扩展
- P2:跨模态(音频/工具输出)bypass 接口实测
7. 与活文档 inference.md 现有脉络的关系
- v82 §2.39.333 LatentPress 候选 ☆ 预备新增锚定实测
- 9-7 早棒 HF Daily 110▲ #4 +2▲ 立标中-高续立饱和实测承接
- 7 日净增 +8 票饱和迹象(102→108→110 vs 同期 Compile by Training +7 / Terminal-Universe +7 / LLaDA-Image +6)→ 饱和速度低于 #1-#3 但高于 #5 之后(饱和区间定位明确)
- paper_card 仍未入库 ⚠️ → 截止 9-15 P1 缺口补强
- 与 ICAE
arXiv:2309.00971形成"adapter 压缩"七栖预备承接 - 与 Gisting / Compressive Transformer / COST / Concatenated Steer 形成"压缩脉络"五栖预备承接
- 与 LongMemEval / LongBench-QA 形成"长上下文评测基线"四栖预备承接
8. 与 v33 已有候选的关系(避免重复归类)
- Compile by Training
arXiv:2609.04199= 端侧神经函数化(同 llm-infra 主轴,但语义正交:Compile by Training 把模型本身压缩,LatentPress 把上下文压缩) - Terminal-Universe
arXiv:2609.04148= agent 环境生成(同 multimodal 邻接级,但语义正交) - LLaDA-Image
arXiv:2609.03796= 原生联合多模态生成(同 multimodal 邻接级,但语义正交) - RoboTok
arXiv:2609.03199= 机器人 RAG(已做 9-7 0940 critical-read,本棒位不重复) - Random Attention
arXiv:2609.03430= KV Cache 淘汰(同 llm-infra 主轴,但语义正交:Random Attention 改 attention,LatentPress 改 embedding 输入) - AsymCache MSA
arXiv:2606.02964= 跨设备 KV 缓存(同 llm-infra 主轴,但语义正交) - SAC CXL
arXiv:2606.19746= CXL KV 缓存(同 llm-infra 主轴,但语义正交) - LatentStream
arXiv:2609.04131= 流式视频潜在记忆(multimodal 主分类 rag,同"潜在表征"概念,语义正交但范式相邻)
判读:LatentPress 在 v33 已锚候选中是第一个把"连续 soft token + 直接 feed embedding"作为上下文压缩主轴的候选,与 ICAE / Gisting 既有脉络形成"压缩脉络五栖预备承接预备触发持续"。
9. arXiv + HF Daily + GitHub + alphaXiv + YouTube 链接清单
- arXiv:
https://arxiv.org/abs/2609.01507+ v2 HTMLhttps://arxiv.org/html/2609.01507v2 - HF Daily:
https://huggingface.co/papers/2609.01507 - GitHub:
https://github.com/HJSang/LatentPress(社区二次实现,验证性中等) - alphaXiv:
https://www.alphaxiv.org/abs/2609.01507 - YouTube:
https://www.youtube.com/watch?v=RfoBLcZvSAs(AI Research Roundup 综述)
10. 一句话总结(本棒位核心结论)
LatentPress 是 v33 以来"压缩必损"翻转为"压缩可增益"的关键候选(LongMemEval 7.70× 0.504 vs raw 0.490),adapter-only 工程轻量,但 R1 adapter-decoder 强绑定 + R2 角色依赖性 + R3 跨模态 bypass 待验证 + R4 帕累托边界不明 + R5 评测集偏置 5 条反方未充分闭合;立标中-高续立饱和 7 日 +8 票,paper_card 仍未入库 ⚠️,建议沿用 v82 §2.39.333 候选 ☆ 预备新增锚定不升 ★,截止 9-15 P1 缺口补强补建 paper_card + GitHub 官方仓库状态核验 + LongMemEval 0.504 跨 seed 稳定性补核。