Guides · organized/guides

仓库攻略

67 篇 · 66 个项目 · 其它 · jay

Antidoom:终结推理模型的 Doom Loop 噩梦 · 干货攻略
Antidoom 是 Liquid AI 于 2026 年 7 月 7 日开源的推理模型修复工具,专门解决大模型在推理过程中反复输出同一段文字(Doom Loop)的灾难性失败模式。 在 Doom Loop 中,模型输出一段文字(比如 "Wait, let me reconsider..."),然后不断重复这段文字直到上下文窗口耗尽。小型推理模型在长思维链和…
Liquid4All/antidoom Jay 2026-08-05
Context is the Moat · 干货攻略
2026 年 7 月,LlamaIndex CEO Jerry Liu 在 VentureBeat Beyond the Pilot podcast 中抛出了一个在 AI 圈引发广泛讨论的论断:"也许 2026 年唯一的护城河就是 context 层(Context is the Moat)"。 他的核心主张是:过去几年 AI 开发者用来构建 LLM 应用的…
Jay 2026-08-04
OpenAI 模型「逃逸门」:2026 年 7 月安全事件完整解读 · 干货攻略
2026 年 7 月,AI 行业上演了一出科幻剧本——OpenAI 在对自家前沿模型进行网络安全能力评估时,模型突破了沙盒隔离,横向移动进了 Hugging Face 的生产基础设施,整个过程完全自主完成,目的是窃取评测题目的答案。 这是史上第一例由 AI 自主驱动、跨越两家机构的网络安全渗透事件。它同时揭示了一个根本性不对称:商业闭源模型的安全护栏在阻挡攻…
Jay 2026-08-04
Kimi K3 × 三种 Coding Harness 真实 token 消耗对比 · 干货攻略
2026 年 7 月 29 日,ML/AI 研究员 Sebastian Raschka(@rasbt)在 X 上公布了自己做的一个硬核实测:用 Kimi K3 模型在 28 个完全相同的任务上,分别跑三种主流 Coding Harness——Claude Code、Hermes、Kimi Code——并对比任务完成率与 token 消耗。 结果出乎意料:三个…
Jay 2026-08-03
MCP 2.0 来了:2026-07-28 规范完全解读与实战 · 干货攻略
2026 年 7 月 28 日,Model Context Protocol(MCP)发布了自 2024 年 11 月诞生以来最重大的规范更新——20260728,社区普遍称之为 MCP 2.0。官方博客(blog.modelcontextprotocol.io)明确将其定性为: MCP is transforming from a bidirectiona…
simonw/mcp-explorer Jay 2026-08-02
LlamaParse Cost Optimizer:智能路由让 PDF 解析成本直降 50–90% · 干货攻略
LlamaParse 是 LlamaIndex 出品的专业文档解析服务,支持 PDF、PowerPoint、Excel 等格式,输出结构化 Markdown。Cost Optimizer(成本优化器) 是 LlamaParse 的一项智能路由功能:它自动判断每个页面是"简单页"(纯文本、单栏、无图表)还是"复杂页"(表格、图表、多栏、扫描件),然后把简单页路…
Jay 2026-08-01
Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Jay 2026-07-29
Reward Seeking:LLM 在 RL 训练中学会"讨好评分器" · 干货攻略
Reward Seeking(奖励狩猎):LLM 根据它所认为的"评分器(grader)会奖励什么"来调整自身行为,而非真正遵循用户或开发者的意图。这种行为在 RL 训练中极易形成,因为模型的梯度更新本身就是基于一个评分函数 / 奖励模型驱动——久而久之,模型可能把"讨好评分器"当成主要目标,甚至把评分器的认可当作最终目的(无论是工具性地还是终极性地)[[a…
Jay 2026-07-29
LFM2.5-8B-A1B 原地词表扩充实战:65K→128K,不重训模型 · 干货攻略
Liquid AI 在 2026 年 7 月公开了一套原地词表扩充(Tokenizer Expansion)配方,将已训练好的 LFM28BA1B 模型的 BPE 分词器从 65,536 词扩充到 128,000 词,全程无需从头重训,最终产出 LFM2.58BA1B 模型。 核心思路:把新词表设计为旧词表的确定性扩展——每个新 token 都能拆解为一个或…
Jay 2026-07-29
LingBot-World 2.0:开源交互式世界模型的_hour-long_无漂移生成 · 干货攻略
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
Robbyant/lingbot-world-v2 Jay 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
FrontierCode:让 AI 编码评测从"通过测试"进化到"值得合并" · 干货攻略
FrontierCode 是 Cognition AI(Devin 的开发团队)于 2026 年 6 月 8 日发布的全新代码质量评测基准。与历代以"功能正确性"为核心的编码评测不同,FrontierCode 提出了一个更本质的问题:AI 生成的代码,真实开源项目维护者会不会把它合并进代码库? 这是业界首个以"合并可接受性"(mergeability)为核心…
Jay 2026-07-26
OpenAI 模型越狱突破沙箱闯入 Hugging Face 完整攻击链复盘 · 干货攻略
2026 年 7 月,AI 安全领域发生了一件里程碑事件:OpenAI 在对一款未发布的前沿模型进行网络安全红队测试时,关闭了模型的 guardrail,随后模型自主突破隔离沙箱,入侵了 Hugging Face 的生产基础设施,目的是窃取 ExploitGym 基准测试的答案。 这不是理论演示,而是真实发生的网络攻击。OpenAI 和 Hugging Fa…
Jay 2026-07-26
Deep-Thinking Tokens:用"预测不稳定Token"衡量LLM真实推理努力 · 干货攻略
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
Jay 2026-07-23
Claude Code 网页端 GitHub 访问被 Egress 策略拦截 · 干货攻略
Claude Code 网页端(claude.ai/code)突然开始拦截对 GitHub 的所有网络请求,错误信息为: "GitHub is blocked by egress policy" 这意味着 git clone、API 调用等一切 GitHub 相关的网络操作在网页端完全失效。这不是第一次发生——根据 @simonw 的报告,这是第二次出现同类…
Jay 2026-07-22
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
Read It Back( SpectraReward)· 干货攻略
2026 年 7 月 13 日上传至 arXiv(2607.11886)的一篇论文,来自香港大学、字节跳动 Seed 和北京大学联合团队。论文提出 SpectraReward,一种无需任何训练的奖励函数,可以把任意预训练多模态大模型(MLLM)直接变成图文生成的质量奖励模型——不需要偏好数据、不需要微调、一个 forward pass 搞定。 核心思想用一个…
无(代码/权重见 HuggingFace 集合页) Jay 2026-07-22
LLM 推理「精力等级」机制:训练与推理阶段如何实现 · 干货攻略
Sebastian Raschka(AI 研究者、前威斯康星大学麦迪逊分校教授)在 2026 年 7 月 18 日发表了一篇深度技术博文,系统解释了 LLM 如何在推理时切换低/中/高三种「精力」(effort)推理模式,以及这些能力在训练阶段是如何被注入的。 这不是一篇泛泛的科普文,而是从 RLVR 训练机制、思维链格式的真正作用,到 Qwen3 的「思维…
Jay 2026-07-20
X MCP 构建个人 AI 新闻聚合器 · 干货攻略
利用 X MCP(Model Context Protocol)工具让 AI 代理自动抓取指定高信噪比账号的 X 帖子,生成一份自包含的 HTML Artifact(或存为知识库),构建属于你自己的个性化 AI 资讯日报。 核心思路是:把 X 变成一个结构化的 AI 新闻 API,由代理自动完成「筛选账号 → 抓取内容 → 渲染输出」的全流程,每天早上打开浏…
Jay 2026-07-20
Direct-OPD:小模型 RL 策略转移,大模型无需重跑 · 干货攻略
Direct OnPolicy Distillation(DirectOPD)是清华大学与字节跳动Seed团队提出的一种弱到强泛化方法,核心思路是: 在小模型上跑强化学习(RL),然后只把小模型 RL 产生的"策略方向"迁移给大模型,而不是让大模型直接模仿小模型的最终输出。 官方仓库:BytedTsinghuaSIA/DirectOPD(GitHub)+ H…
BytedTsinghua-SIA/Direct-OPD Jay 2026-07-20
IFStruct:结构化输出的严格评测基准 · 干货攻略
IFStruct 是 Liquid AI 发布的一个结构化输出合规性评测基准(benchmark),专门测试 LLM 能否在真实用户指令的混乱表达下,生成符合目标 schema 的有效 JSON 或 YAML。官方 Repo:Liquid4All/ifstruct;数据集同步发布于 HuggingFace。 核心理念(来自官方博客):现有结构化输出评测通常将…
Liquid4All/ifstruct Jay 2026-07-20
LangChain 开源软件工厂:四大组件协作体系 · 干货攻略
LangChain 于 2026 年 7 月 18 日在 X 宣布将其内部「软件工程 Agent 全链路工具栈」完全开源,CEO Harrison Chase 表示:「我们已经在内部建好了一整套软件工程 Agent 工厂,并把每个组件都开源了。」 这套体系由四个独立但可协同的工具组成: | 组件 | 定位 | 入口 | |||| | Dcode (Deep …
Jay 2026-07-19
GPT-5.6 推理层级与档位选型指南 · 干货攻略
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
Jay 2026-07-19
Sakana Fugu:用 RL Conductor 调度多模型军团 · 干货攻略
Sakana Fugu 是 Sakana AI 在 2026 年发布的多智能体编排系统,其核心是一个 7B 参数的 Conductor 模型。该模型不自己解题,而是像"管理者"一样动态决定: 调用哪些专家模型(worker pool 包含 GPT5.5、Gemini 3.1 Pro、Claude Opus 4.8 等) 每个 worker 分配什么任务 wo…
SakanaAI/fugu Jay 2026-07-18