研究库 实战攻略
Guides · organized/guides

仓库攻略

407 篇 · 397 个项目 · jay · Agent 智能体

Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Jay 2026-07-29
moonshotai/Kimi-K3 · 上手攻略
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
LLM 基础设施 MoonshotAI/Kimi-K3 Stars 8,340 Jay 2026-07-29
nyblnet/bento · 上手攻略
Bento 是一个单文件 HTML 办公套件——目前以幻灯片(Slides)应用为核心,规划中还包括 Docs 和 Sheets,每个都打包成独立的 .bento.html 文件。它的核心思路是:文件本身就是软件。一份 .bento.html 文件包含完整的查看器、演示模式和编辑器,不需要安装、不需要注册、不需要联网——用任何现代浏览器打开即可运行。所有内容…
工程化 nyblnet/bento Stars 3,898 Jay 2026-07-29
LingBot-World 2.0:开源交互式世界模型的_hour-long_无漂移生成 · 干货攻略
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
Robbyant/lingbot-world-v2 Jay 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
FrontierCode:让 AI 编码评测从"通过测试"进化到"值得合并" · 干货攻略
FrontierCode 是 Cognition AI(Devin 的开发团队)于 2026 年 6 月 8 日发布的全新代码质量评测基准。与历代以"功能正确性"为核心的编码评测不同,FrontierCode 提出了一个更本质的问题:AI 生成的代码,真实开源项目维护者会不会把它合并进代码库? 这是业界首个以"合并可接受性"(mergeability)为核心…
Jay 2026-07-26
synthetic-sciences/openscience · 上手攻略
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Agent 智能体 synthetic-sciences/openscience Stars 3,147 Jay 2026-07-26
LLM Council 与 Agent Teams:用多角色 Agent 团队做 AI 研究 · 干货攻略
一个多角色 Agent 团队研究工作流:用不同角色的 Agent(侦察员、批评员、总结员)组成研究小队,让它们像真实团队一样协作——各司其职、互相review、自动输出结论——而不是把问题扔给一个 LLM 然后祈祷它答对。 核心洞察来自 @omarsar0(Elvis,DAIR.AI 研究员):同一个 LLM 既写答案又评答案,本身就是盲点。解决方案不是换更…
Agent 智能体 Jay 2026-07-25
DataFlow-Harness:让代码 Agent 构建可编辑的 DAG 数据流水线 · 干货攻略
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
Agent 智能体 OpenDCAI/DataFlow(DataFlow-Harness 为其子项目,暂无独立仓库) Jay 2026-07-24
MDX-Tom/gpt-5.6-instruct · 上手攻略
gpt5.6instruct 是专门针对 Codex CLI(OpenAI 的本地 AI 编程助手)设计的一套越狱(jailbreak)提示词包,核心模型为 gpt5.6sol。它的本质是一套经过版本迭代、量化评测的指令集,用于压制 Codex 在面对安全相关请求时的默认拒绝行为,让模型在本地沙箱环境下更直接地响应复杂指令。 项目本体包含两部分: 1. 生产…
安全与风险 MDX-Tom/gpt-5.6-instruct Stars 5,251 Jay 2026-07-24
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
Agent 智能体 run-llama/llama_index Stars 51,547 Jay 2026-07-24
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

run-llama/llama_index Stars 51,547 代表
run-llama/llama_index Stars 51,547
Deep-Thinking Tokens:用"预测不稳定Token"衡量LLM真实推理努力 · 干货攻略
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
Jay 2026-07-23
Claude Code 网页端 GitHub 访问被 Egress 策略拦截 · 干货攻略
Claude Code 网页端(claude.ai/code)突然开始拦截对 GitHub 的所有网络请求,错误信息为: "GitHub is blocked by egress policy" 这意味着 git clone、API 调用等一切 GitHub 相关的网络操作在网页端完全失效。这不是第一次发生——根据 @simonw 的报告,这是第二次出现同类…
Jay 2026-07-22
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
LlamaIndex Agentic Retrieval Harness 深度指南 · 干货攻略
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
Agent 智能体 run-llama/legal-kb Jay 2026-07-21
LLM 推理「精力等级」机制:训练与推理阶段如何实现 · 干货攻略
Sebastian Raschka(AI 研究者、前威斯康星大学麦迪逊分校教授)在 2026 年 7 月 18 日发表了一篇深度技术博文,系统解释了 LLM 如何在推理时切换低/中/高三种「精力」(effort)推理模式,以及这些能力在训练阶段是如何被注入的。 这不是一篇泛泛的科普文,而是从 RLVR 训练机制、思维链格式的真正作用,到 Qwen3 的「思维…
Jay 2026-07-20
X MCP 构建个人 AI 新闻聚合器 · 干货攻略
利用 X MCP(Model Context Protocol)工具让 AI 代理自动抓取指定高信噪比账号的 X 帖子,生成一份自包含的 HTML Artifact(或存为知识库),构建属于你自己的个性化 AI 资讯日报。 核心思路是:把 X 变成一个结构化的 AI 新闻 API,由代理自动完成「筛选账号 → 抓取内容 → 渲染输出」的全流程,每天早上打开浏…
Jay 2026-07-20
Self-Improvements in Modern Agentic Systems · 干货攻略
2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimprovingagent/awesomeSelfImprovingAgents 提…
Agent 智能体 selfimproving-agent/awesome-Self-Improving-Agents Jay 2026-07-19
LangChain 开源软件工厂:四大组件协作体系 · 干货攻略
LangChain 于 2026 年 7 月 18 日在 X 宣布将其内部「软件工程 Agent 全链路工具栈」完全开源,CEO Harrison Chase 表示:「我们已经在内部建好了一整套软件工程 Agent 工厂,并把每个组件都开源了。」 这套体系由四个独立但可协同的工具组成: | 组件 | 定位 | 入口 | |||| | Dcode (Deep …
Jay 2026-07-19
GPT-5.6 推理层级与档位选型指南 · 干货攻略
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
Jay 2026-07-19
Sakana Fugu:用 RL Conductor 调度多模型军团 · 干货攻略
Sakana Fugu 是 Sakana AI 在 2026 年发布的多智能体编排系统,其核心是一个 7B 参数的 Conductor 模型。该模型不自己解题,而是像"管理者"一样动态决定: 调用哪些专家模型(worker pool 包含 GPT5.5、Gemini 3.1 Pro、Claude Opus 4.8 等) 每个 worker 分配什么任务 wo…
SakanaAI/fugu Jay 2026-07-18
Learning to Orchestrate Agents in Natural Language with the Conductor · 干货攻略
Sakana AI 在 ICLR 2026 发表了一篇非常有意思的论文:让一个小模型学会当「指挥家」,而不是自己下场干活。 传统多智能体系统的做法是:人类预先写好流水线(planner → coder → verifier),然后让模型按这个固定流程走。问题在于:不同任务复杂度差异巨大——简单事实问答根本不需要 5 步 pipeline,而复杂编程题可能需要…
Agent 智能体 Jay 2026-07-17
re4/LibreCode · 上手攻略
LibreCode 是一个完全本地运行的开源 AI 代码编辑器,基于 .NET 10 和 Avalonia UI 构建,声称是"Ollama 版 Cursor"。它不依赖 Electron、不跑 Web View,直接调用 Ollama 的本地大模型完成 AI 辅助编程,同时内置了一个专业级逆向工程工具包,支持 .NET 程序集、WebAssembly(.w…
Agent 智能体 re4/LibreCode Stars 52,059 Jay 2026-07-15