JustinTime Agentic OCR(JIT OCR)是 LlamaIndex CEO Jerry Liu(@jerryjliu0)命名并系统阐述的一种文档解析模式,官方博客完整阐述见 llamaindex.ai/blog/justintimeagenticocr。 核心思想很简单:不要一开始就对所有文档跑昂贵的 VLM OCR,先用轻量免费工具快速…
仓库攻略
244 篇 · 241 个项目 · Agent 智能体 · jay
FineEnvs MultiHarness RL 是 Adithya S K(@adithya_s_k)于 2026 年 10 月 1 日发布的一套开源实践,完整仓库位于 adithyask/FineEnvs,配套文章见 HF Space · multiharnessrl。 它的核心命题是:训练数据和算法不是瓶颈,Harness(智能体框架)才是。 所谓 H…
CorpusMap 是微软 + KAIST 联合论文 Follow the Entities: A Corpus Map for Agentic Search(arXiv:2609.37226,2026 年 9 月 29 日提交)提出的离线实体导航层。 核心问题:企业文档集合里,答案所需的证据散落在多份文档中(一份记录审批、一份记录需求、一份记录最新状态),…
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
REA(Reverse Engineer Anything)是一个连接 AI Coding Agent 与逆向工程工具链的 MCP(Model Context Protocol)中间件。它的核心价值是:让 AI 代理在不了解源码的情况下,通过 Hopper、Ghidra、IDA Pro 等二进制分析引擎,理解和复现目标应用的行为。 支持的被分析目标包括: J…
注意:仓库名称有一定迷惑性——它并非自动交易机器人,而是一个纯终端界面的 Ethereum 智能合约部署与管理工具。 核心功能是:本地编译 Solidity、实时预览 gas 费用、部署到 Ethereum Mainnet,并通过交互式菜单调用合约函数。内置可选的前置运行(frontrunning)示例逻辑和一个独立的 mempool 监控进程,用途更偏向"…
2026年9月,LlamaIndex CEO Jerry Liu 在 AI Engineer World's Fair 2026(AI工程师世界博览会)发表了一场21分钟演讲,标题为 "Building the Document Context Layer for AI Agents"(为 AI Agent 构建文档上下文层)。这场演讲的核心论点是: RAG…
ScholarEvolve 是 2026 年 9 月 30 日在 arXiv(2610.00972)发表的一篇论文提出的框架,核心解决一个问题:当新的 Agent 论文发表后,如何让 Harness 自动跟着演进,而不是等人类工程师手动实现? 它把论文翻译成 Harness 改进分成四步:研究 Agent 审计失败 → 检索相关论文 → 写变异蓝图 → 编码…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
2026 年 10 月 3 日,Simon Willison(Django 联合创始人、DataSette 作者)在 simonwillison.net 发文,系统阐述了 LLM API 与 AI Agent 必须在服务层面默认开启硬性预算上限 这一工程原则。 核心主张:一切按量付费的 API 和云服务,都应该让用户能设置"月度消费超 $X 后直接返回错误、…
2026 年 10 月 1 日,Hugging Face 与 Liquid AI 联合发布了 OpenEnv 多 Harness 同步 RL 训练栈,核心方法论见"The ultimate guide to multiharness RL"(Adithya S Kolavi 等 8 位作者)。该工作的核心洞察是: 同一个模型权重,在不同 Agent Harn…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
MCP(Model Context Protocol)是 Anthropic 于 2024 年末开源的 AI Agent 工具调用协议,旨在标准化"大模型如何调用外部工具"这件事。2026 年 7 月 28 日,MCP 发布重大版本(规范代号 20260728),核心变化是彻底移除会话层,将协议改造为纯请求/响应无状态架构。 这次变化直接影响:使用 MCP …
ufocore 是一个开源的 AI Agent 运行时(runtime),让团队成员在聊天中给 AI Agent 分配任务,Agent 可以读取文件和执行命令来完成工作。它是 UFO 托管服务(ufo.ai)的开源实现,支持自托管,用自己的模型 API key 在自己的基础设施上运行 AI Agent。 核心设计哲学:一个进程,多种部署规模。SQLite +…
premierepromcp 是一个基于 MCP(Model Context Protocol) 的本地优先服务器,让 AI 助手(Claude、Codex、Cursor 等)通过 Adobe Premiere Pro 原生 CEP/ExtendScript 接口直接控制 Premiere Pro。它不是 Premiere 的 AI 生成功能,而是给 AI …
LFM2.52.6B 是 Liquid AI 于 2026 年 8 月 4 日开源的端侧 Agent 模型:2.6B 参数、128K 上下文窗口、支持原生工具调用,可在手机、笔记本、PC 和机器人上完全本地运行,数据不离开设备,推理边际成本为零。 本攻略不是关于模型评测或部署的——而是深度解析它的后训练管线:如何把一个基座模型(2.6B 参数、~34T to…
AIHOT 是一个自己找热点、自己写日报的网站框架。它的定位是:让你不需要写一行爬虫,不需要盯着后台,只要配置好转用的信源和精选标准,它就能每天自动给你出一份结构化行业日报。 这个仓库是 aihot.news(作者自营的 AI 行业热点站)的完整代码快照,包含:信源抓取层、内容精选流程、LLM 评分与打分两次独立校验、内容聚簇与热度计算、中文标题/摘要生成、…
SeepReverseLab(简称 Seep)是一个面向 AI Agent 的多平台客户端逆向工程自动化工作台,同时也是一套 CWE602(客户端授权脆弱性)专项审计框架。它将 Radare2、JADX、Apktool、Frida、IDA Pro 等分散的逆向工具链,封装为统一的 MCP(Model Context Protocol)工具矩阵,让 AI Ag…
本篇来自 @omarsar0(elvis)的实操教程,基于 LangChain 官方博客上 Sydney Runkle 的同名文章,用 Pi SDK(TypeScript AI Agent 开发工具包)从零实现一套完整的三段式 Agent Harness,并将 Jev(TypeSafe AI 的决策模型)接入每个决策节点。 Pi SDK(github.com…
WebCodex 是一个本地开发环境桥接工具,让云端 AI Agent(如 ChatGPT、Claude)直接使用你本机已有的真实代码仓库、Git 工作区和开发工具链,而不需要把代码上传到任何托管服务或云端沙箱。 核心定位是把「AI 客户端(MCP)」和「你的真实机器」连接起来:AI 负责理解、修改、审查代码,运行测试和命令;代码、编译器、Git 历史都在你…
代表攻略
用 Pi SDK + Jev 构建自定义 Agent Harness · 干货攻略
Pi SDK(earendilworks/pi)是 earendilworks 出品的 TypeScript Agent 开发工具包,包含多个可独立使用的包: | 包名 | 用途 | ||| | @earendilworks/piagentcore | Agent 运行时,含工具调用与会话状态管理 | | @earendilworks/piai | 统一 L…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
earendil-works/pi
Stars 82,886
代表
earendil-works/pi
Stars 82,886
Jev Social 是一个浏览器 grounded 社交媒体研究智能体,将 AI 决策模型(Jev)与真实 Chrome 浏览器操作(socai CLI)配对,对 Instagram、TikTok、LinkedIn 三个平台执行可验证的社交研究任务。Jev 负责每一步「搜索 / 打开某个主页 / 阅读某条评论 / 下载视频 / 结束」的选择决策;socai…
JITAgent(arXiv:2608.25593)是一个任务时动态生成 Agent 架构的研究系统。与其给所有任务预配置一套固定的 Agent 框架,JITAgent 用一个 27B 的元模型(metamodel)在看到任务时才生成专属 harness——包含 memory(记忆)、planning(规划)、action(执行)、capability(工具…
集体失控(Collective Loss of Control) 是 2026 年 9 月腾讯朱雀实验室(Tencent Zhuque Lab)发表的一篇论文(arXiv:2609.18460)中提出的概念,用于解释多 Agent 系统如何从一次局部偏差演化为集体性故障。论文的核心理论框架将多 Agent 失控建模为流行病传播——三个阶段:意外突变(Muta…
Visual Grounding(视觉定位)是 2026 年 PDF Agent 工程中最重要的却被严重低估的能力。它指的是:给定一段文本描述,模型需要找到该描述对应的图像/文档区域——具体到 bounding box(边界框)、页码、词级别或行级别的精确位置。 在 PDF Agent 场景下,Visual Grounding 意味着:Agent 回答"这份…
metapipe 是一个基于 Claude Code 的端到端系统综述(Systematic Review)与元分析(MetaAnalysis)自动化 pipeline。你给一个研究主题,Claude Code 自动完成从文献检索、筛选、数据提取、统计分析到生成符合期刊格式的手稿,整个过程模块化、可重现、留有 5 个强制人工决策点。 核心逻辑:用 Claud…
Jev(发音 "Jeve")是一个装在 Android 手机上的对话副驾,核心逻辑是:先判断对方真实意图与危险等级,再据此起草候选回复,最终把回复填入输入框——发不发永远由你手动点。 大多数 AI 辅助回复工具直接让模型生成一句回复。Jev 的差异在于引入了独立的判断模型(Jev 判断层):它一次回答七道题——对方意图是什么、危险等级几档(1–9)、对方要什…
2026 年 9 月,LangChain 正式集成 TypeSafe AI 的 Jev——一个非传统 LLM 的"System One"判决模型。Jev 不生成文本,而是接收一段状态(state)和若干结构化问题,返回置信概率和分类决策。LangChain 通过 langchaintypesafe 包将 Jev 接入 agent harness,为两个高频决…