dairai/wikisft 是一个配套仓库,完整复现了 @omarsar0(elvis)发表在 X 上的文章《Automating LLM FineTuning with Fireworks Agent》的数据构建流程。 核心思路来自 Andrej Karpathy 的 LLM Wiki 概念:把个人知识库的"输出风格"通过 SFT 微调蒸馏进模型权重,而…
仓库攻略
13 篇 · 13 个项目 · 其它 · jay · RAG 检索增强
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工作负载模型,基于 Gemini 3.6 Flash 的算法改进版,主打编码和 Agent 场景。官方标称上下文窗口为 1,048,576 tokens(约 1M),最大输出 65,536 tokens(64K),支持文本、图像、音频、视频、PDF 多模态输入。 本攻…
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。 核心论文:"Addressing the Orchestration Gap in Generalist Robots via…
LFM2.52.6B 是 Liquid AI 在 2026 年 8 月初开源的一个 2.6B 参数端侧 Agent 模型,DeepSeekV4Flash0731 是 DeepSeek 同月发布的一个 284B 总参数 / 13B 激活参数 MoE 推理优化模型(20260731 发布)。2026 年 8 月 6 日,atomic.chat 在 4× RTX …
@omarsar0 在 2026 年 8 月初发帖指出:"Token efficiency on these models are underestimated"——DeepSeek V4Flash 每 token 价格之低掩盖了一个关键事实:单任务总成本(pertask cost)并不等同于每 token 单价(pertoken price)。当模型为完成…
2026 年 7 月,LlamaIndex CEO Jerry Liu 在 VentureBeat Beyond the Pilot podcast 中抛出了一个在 AI 圈引发广泛讨论的论断:"也许 2026 年唯一的护城河就是 context 层(Context is the Moat)"。 他的核心主张是:过去几年 AI 开发者用来构建 LLM 应用的…
LlamaParse 是 LlamaIndex 出品的专业文档解析服务,支持 PDF、PowerPoint、Excel 等格式,输出结构化 Markdown。Cost Optimizer(成本优化器) 是 LlamaParse 的一项智能路由功能:它自动判断每个页面是"简单页"(纯文本、单栏、无图表)还是"复杂页"(表格、图表、多栏、扫描件),然后把简单页路…
Liquid AI 在 2026 年 7 月公开了一套原地词表扩充(Tokenizer Expansion)配方,将已训练好的 LFM28BA1B 模型的 BPE 分词器从 65,536 词扩充到 128,000 词,全程无需从头重训,最终产出 LFM2.58BA1B 模型。 核心思路:把新词表设计为旧词表的确定性扩展——每个新 token 都能拆解为一个或…
2026 年 7 月,Anthropic 将 Claude Code 的 system prompt 裁剪了 80%,用于最新一代 Claude 5 模型(Opus 5、Fable 5,又称 Mythos 系列)。结果:coding eval 无任何可测量的质量下滑。 这一举动揭示了 Claude 5 时代最重要的 prompt 认知反转:塞入大量示例、禁止…
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
NapMem(Navigate over Pyramid Memory)是阿里巴巴 Qwen 团队与多所高校在 2026 年 7 月 7 日联合发布的论文提出的框架,核心思想是:把长期用户记忆从被动检索变成 Agent 可主动探索的结构化动作空间。 目前主流的记忆系统(如 Mem0、Zep、MemoryBank)都是被动 RAG 模式——检索组件从数据库捞取…