Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
仓库攻略
405 篇 · 395 个项目 · jay · Agent 智能体
JustinTime Agentic OCR(JIT OCR)是 LlamaIndex CEO Jerry Liu(@jerryjliu0)命名并系统阐述的一种文档解析模式,官方博客完整阐述见 llamaindex.ai/blog/justintimeagenticocr。 核心思想很简单:不要一开始就对所有文档跑昂贵的 VLM OCR,先用轻量免费工具快速…
FineEnvs MultiHarness RL 是 Adithya S K(@adithya_s_k)于 2026 年 10 月 1 日发布的一套开源实践,完整仓库位于 adithyask/FineEnvs,配套文章见 HF Space · multiharnessrl。 它的核心命题是:训练数据和算法不是瓶颈,Harness(智能体框架)才是。 所谓 H…
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
CorpusMap 是微软 + KAIST 联合论文 Follow the Entities: A Corpus Map for Agentic Search(arXiv:2609.37226,2026 年 9 月 29 日提交)提出的离线实体导航层。 核心问题:企业文档集合里,答案所需的证据散落在多份文档中(一份记录审批、一份记录需求、一份记录最新状态),…
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
REA(Reverse Engineer Anything)是一个连接 AI Coding Agent 与逆向工程工具链的 MCP(Model Context Protocol)中间件。它的核心价值是:让 AI 代理在不了解源码的情况下,通过 Hopper、Ghidra、IDA Pro 等二进制分析引擎,理解和复现目标应用的行为。 支持的被分析目标包括: J…
2026年9月,LlamaIndex CEO Jerry Liu 在 AI Engineer World's Fair 2026(AI工程师世界博览会)发表了一场21分钟演讲,标题为 "Building the Document Context Layer for AI Agents"(为 AI Agent 构建文档上下文层)。这场演讲的核心论点是: RAG…
ScholarEvolve 是 2026 年 9 月 30 日在 arXiv(2610.00972)发表的一篇论文提出的框架,核心解决一个问题:当新的 Agent 论文发表后,如何让 Harness 自动跟着演进,而不是等人类工程师手动实现? 它把论文翻译成 Harness 改进分成四步:研究 Agent 审计失败 → 检索相关论文 → 写变异蓝图 → 编码…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
2026 年 10 月 3 日,Simon Willison(Django 联合创始人、DataSette 作者)在 simonwillison.net 发文,系统阐述了 LLM API 与 AI Agent 必须在服务层面默认开启硬性预算上限 这一工程原则。 核心主张:一切按量付费的 API 和云服务,都应该让用户能设置"月度消费超 $X 后直接返回错误、…
2026 年 10 月 1 日,Hugging Face 与 Liquid AI 联合发布了 OpenEnv 多 Harness 同步 RL 训练栈,核心方法论见"The ultimate guide to multiharness RL"(Adithya S Kolavi 等 8 位作者)。该工作的核心洞察是: 同一个模型权重,在不同 Agent Harn…
FPF(First Principles Framework)是一套 AI 原生的声明式模式语言(pattern language)体系,面向系统工程、研究和管理的知识框架。 FPF 的核心思想是:为工程师和 AI Agent 提供一套共享、精确的语言,用来描述系统(System)、方法(Method)、工作(Work)、证据(Evidence)、决策(De…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
MCP(Model Context Protocol)是 Anthropic 于 2024 年末开源的 AI Agent 工具调用协议,旨在标准化"大模型如何调用外部工具"这件事。2026 年 7 月 28 日,MCP 发布重大版本(规范代号 20260728),核心变化是彻底移除会话层,将协议改造为纯请求/响应无状态架构。 这次变化直接影响:使用 MCP …
ufocore 是一个开源的 AI Agent 运行时(runtime),让团队成员在聊天中给 AI Agent 分配任务,Agent 可以读取文件和执行命令来完成工作。它是 UFO 托管服务(ufo.ai)的开源实现,支持自托管,用自己的模型 API key 在自己的基础设施上运行 AI Agent。 核心设计哲学:一个进程,多种部署规模。SQLite +…
SAG(SQLRetrieval Augmented Generation)是 ZleapAI 提出的一种全新检索架构,不是对传统 dense RAG 和 GraphRAG 的缝合,而是用事件实体索引 + 查询时动态超边(hyperedge)的原生设计,在语义检索和关系推理上合二为一。 SAG 同时也是一个完整的知识库应用(桌面 + Docker 部署),支…
代表攻略
LFM2.5-2.6B 四阶段后训练全解:从 SFT 到 Agentic RL 的端侧 Agent 模型炼成记 · 干货攻略
LFM2.52.6B 是 Liquid AI 于 2026 年 8 月 4 日开源的端侧 Agent 模型:2.6B 参数、128K 上下文窗口、支持原生工具调用,可在手机、笔记本、PC 和机器人上完全本地运行,数据不离开设备,推理边际成本为零。 本攻略不是关于模型评测或部署的——而是深度解析它的后训练管线:如何把一个基座模型(2.6B 参数、~34T to…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
代表攻略
LiteParse:空间布局优先的本地文档解析——表格空白格错位的根本解法 · 干货攻略
LiteParse 是 LlamaIndex 于 2026 年 3 月开源的本地文档解析 CLI 和 TypeScript 原生库,核心理念是「保留布局,而非检测结构」——将 PDF、Office 文档、图片中的文本投影到空间网格(spatial grid),以相对位置关系输出文本,而不是先将文档结构检测并转换为 Markdown 表格。 这直接回应了 @j…
dshourfreemodel 是一个 DeepSeek Harness(dsh)插件,装上之后不需要登录、不需要注册、不需要填任何 API Key,就能直接使用包括 Muse Spark 1.3、MiMo V2.6 在内的前沿大模型——完全免费,不限量。 它的工作原理是在 dsh 的插件系统里挂载一个模型转发层,所有请求经过 OpenCode 的 Zen …
AIHOT 是一个自己找热点、自己写日报的网站框架。它的定位是:让你不需要写一行爬虫,不需要盯着后台,只要配置好转用的信源和精选标准,它就能每天自动给你出一份结构化行业日报。 这个仓库是 aihot.news(作者自营的 AI 行业热点站)的完整代码快照,包含:信源抓取层、内容精选流程、LLM 评分与打分两次独立校验、内容聚簇与热度计算、中文标题/摘要生成、…
代表攻略
SAS:端到端优化上下文排名的稀疏注意力机制 · 干货攻略
SAS(Simple Attention Sparsification via EndtoEnd Optimization of Context Ranking) 是腾讯混元(Hunyuan)团队提出的一种后训练稀疏注意力机制,核心贡献是让选择器(selector)能够直接被语言建模损失端到端反向更新,从而在固定注意力预算下学会最有效地排列和选择上下文块。 …
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
2026 年 9 月 27 日,AI 领域知名独立开发者 Simon Willison 在 WeAreDevelopers World Congress North America(圣何塞)发表了闭幕 Keynote,题目为「2026 in LLMs (so far)」。这是一篇按时间线串联 2026 年 AI 领域所有重大事件的超长综述,涵盖从 GPT5.…
SeepReverseLab(简称 Seep)是一个面向 AI Agent 的多平台客户端逆向工程自动化工作台,同时也是一套 CWE602(客户端授权脆弱性)专项审计框架。它将 Radare2、JADX、Apktool、Frida、IDA Pro 等分散的逆向工具链,封装为统一的 MCP(Model Context Protocol)工具矩阵,让 AI Ag…
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。 核心发现…