2026 年 7 月 28 日,Model Context Protocol(MCP)发布了自 2024 年 11 月诞生以来最重大的规范更新——20260728,社区普遍称之为 MCP 2.0。官方博客(blog.modelcontextprotocol.io)明确将其定性为: MCP is transforming from a bidirectiona…
仓库攻略
201 篇 · 199 个项目 · jay · LLM 基础设施
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
ECHO(Environment Crossentropy Hybrid Objective)是一个让 CLI Agent 在 RL 训练过程中同时学习预测环境响应(terminal 输出)的混合目标函数,来自论文 arXiv:2605.24517(2026 年 5 月),由 Microsoft Research AI Frontiers 和 Prime I…
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
Liquid AI 在 2026 年 7 月公开了一套原地词表扩充(Tokenizer Expansion)配方,将已训练好的 LFM28BA1B 模型的 BPE 分词器从 65,536 词扩充到 128,000 词,全程无需从头重训,最终产出 LFM2.58BA1B 模型。 核心思路:把新词表设计为旧词表的确定性扩展——每个新 token 都能拆解为一个或…
LlamaParse Retrieval Harness(发布于 2026 年 6 月 29 日)是 LlamaIndex 在 LlamaParse Index v2 中推出的一套面向 Agent 的文档检索工具集。它不再把文档库当成一个静态向量数据库让 Agent 做一次语义搜索,而是把整个索引暴露为一组类文件系统接口——Agent 可以主动 list、g…
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Claude Code 动态工作流(Dynamic Workflows)是 Anthropic 于 2026 年 5 月 28 日(随 Opus 4.8 发布)推出的研究预览功能,核心解决一个长期难题:LLM Agent 的编排逻辑(即"谁在什么时机调用谁")本质上是硬编码的,无法动态适应任务规模。 动态工作流的解法是:让 Claude 自己写一个 Java…
ReplaySSM(JohnnyLiou / Dao AI Lab,2026 年 6 月 15 日发布)是一种让混合状态空间模型(Hybrid SSM)在 vLLM 推理引擎中同时加速自回归解码和推测解码的核内核优化技术。其核心洞察极其简洁: 不要每步都把 SSM recurrent state 写回 HBM——缓存最近的 SSM 输入,需要时再重建状态。 …
koreanlawmcp 是一个基于韩国法制处(법제처)Open API 的 MCP(Model Context Protocol)服务器,同时附带 CLI 工具。它将韩国 42 个官方法律 API 压缩为 10 个核心工具,让 AI 助手(Claude Desktop、Cursor、Windsurf、Zed 等)能够实时查询、验证和分析韩国成文法和判例。 …
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
run-llama/llama_index
Stars 51,547
代表
run-llama/llama_index
Stars 51,547
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
Direct OnPolicy Distillation(DirectOPD)是清华大学与字节跳动Seed团队提出的一种弱到强泛化方法,核心思路是: 在小模型上跑强化学习(RL),然后只把小模型 RL 产生的"策略方向"迁移给大模型,而不是让大模型直接模仿小模型的最终输出。 官方仓库:BytedTsinghuaSIA/DirectOPD(GitHub)+ H…
IFStruct 是 Liquid AI 发布的一个结构化输出合规性评测基准(benchmark),专门测试 LLM 能否在真实用户指令的混乱表达下,生成符合目标 schema 的有效 JSON 或 YAML。官方 Repo:Liquid4All/ifstruct;数据集同步发布于 HuggingFace。 核心理念(来自官方博客):现有结构化输出评测通常将…
FlashAttention4(FA4)是 Tri Dao 团队发布的第四代 IOaware 精确注意力内核,针对 NVIDIA Blackwell 架构(B200/GB200)全面重新设计,同时保留对 Hopper(H100)的支持。FA4 以 CuTeDSL(NVIDIA CUTLASS DSL)编写,在运行时编译为 PTX/CUBIN,核心定位是解决 …
astridruntime/book 是 Unicity Astrid OS 的权威技术参考文档,同样基于 mdBook 构建。它是理解 Astrid 操作系统内部设计的完整手册,面向构建 Capsule(胶囊)或深入理解系统架构的开发者。 Astrid OS 是一个专为 AI Agent 设计的操作系统,它的核心设计哲学是:像操作系统对待进程一样对待 AI…
ZenML 是一个面向 ML/AI 工程师的统一 AI 平台,核心价值主张是:一次编写,随处运行——用 Python 装饰器定义管道(pipelines)和步骤(steps),ZenML 自动处理容器化、追踪、部署和基础设施抽象,让你无需改动代码即可在本地、Kubernetes、云端之间切换。 ZenML 的定位介于实验追踪工具(MLflow、W&B)和完整…
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
Void 是一个基于 VS Code 的开源 AI 代码编辑器,由 YC 支持的初创公司 Glass Devtools 开发。它在 VS Code 基础上引入了 AI Agent 能力——支持在代码库上运行 AI Agent、Checkpoint 可视化、以及任意模型或 API 的本地接入。数据直接发送给提供商,不在 Void 侧留存。 ⚠️ 重要状态:Vo…
ThinkingCapQwen3.627B 是由 BottleCap AI 发布的推理效率优化微调模型,基于 Qwen 团队 2026 年 4 月开源的 Qwen3.627B(稠密 27B 参数多模态模型,支持思维链推理与非思维推理双模式)进行微调,核心目标是:在保持答案质量和风格完全不变的前提下,系统性削减推理时的"思考 Token"数量。 原帖分享者 @…
DocsGPT 是一个开源的私有 AI 知识库与 Agent 构建平台,专注于让团队在完全私有化的环境下,对文档、代码库、内部知识进行 AI 问答与智能搜索。它融合了 RAG(检索增强生成)、多模型支持、Deep Research 模式和低代码 Agent 可视化构建器,适合企业和开发者私有部署。 核心定位:把 LangChain + RAG + Agent…
ClearML 是一个开源的 ML/DL/GenAI 全栈开发与生产平台,涵盖实验管理(Experiment Manager)、数据管理与版本控制(HyperDatasets)、MLOps/LLMOps 编排(Agent + Orchestration)、模型服务(Model Serving)、报表与可视化(Reports)五大模块。用作者自己的话说:解决的…
NirDiamant/Prompt_Engineering 是由 AI 教育博主 Nir Diamant 维护的提示工程(Prompt Engineering)教程仓库,汇集了 22 种提示工程技术的 Jupyter Notebook 实战教程,从最基础的单轮/多轮提示模板到 ChainofThought、SelfConsistency、TreeofThou…
MathJax 是一个开源 JavaScript 渲染引擎,专门在浏览器中高质量地显示 LaTeX、MathML 和 AsciiMath 数学公式。它不需要用户安装任何插件或额外字体,只要网页里引用了 MathJax,公式就会自动渲染出来。 MathJax 诞生于 2010 年前后,至今仍是 Web 数学渲染的事实标准,被 arXiv、Stack Overf…