coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
仓库攻略
118 篇 · 117 个项目 · jay · RAG 检索增强
Eidos 是一个私有的、自托管的跨机器文件搜索系统,让你用"记忆"而非"路径"来搜索文件。它能同时索引工作站、笔记本、服务器、虚拟机(VM)、网络存储和压缩档案,从一个统一入口返回跨所有设备的搜索结果——无需记住"文件在哪台机器上"。 与普通桌面搜索(只能搜本机)、云盘搜索(只能搜云端内容)、向量搜索(丢失文件身份与位置)不同,Eidos 的核心思路是:先…
dshios(DeepSeek Harness iOS)是 DeepSeek Harness(DSH)的插件,将一个可交互的 iOS Simulator 实时画面和一台通过 USB 连接的 iPhone 整体嵌入 DSH 对话中。AI Agent 获得了 22 个工具来控制 iOS 模拟器或真机——启动/关闭设备、截图、UI 自动化(通过无障碍树或 OCR …
dairai/wikisft 是一个配套仓库,完整复现了 @omarsar0(elvis)发表在 X 上的文章《Automating LLM FineTuning with Fireworks Agent》的数据构建流程。 核心思路来自 Andrej Karpathy 的 LLM Wiki 概念:把个人知识库的"输出风格"通过 SFT 微调蒸馏进模型权重,而…
SynaLinks/synalinksskills 是一套面向 AI 编程 Agent 的 SKILL.md 技能包,专门教 Claude Code、Codex、OpenCode、pi 等主流 coding agent 如何写出符合 SynaLinks 框架规范的代码。技能本身是一个标准化的 SKILL.md 文件,基于 Anthropic 主导的 Agen…
RAGSurvey 是一个按体系分类的 RAG 论文Awesome 列表,对应论文 RetrievalAugmented Generation for AIGenerated Content: A Survey(arXiv:2402.19473,2024 年 2 月,北大/北大深圳研究生院团队)。仓库按该论文提出的三层分类法,对 RAG 领域论文进行结构化整…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工作负载模型,基于 Gemini 3.6 Flash 的算法改进版,主打编码和 Agent 场景。官方标称上下文窗口为 1,048,576 tokens(约 1M),最大输出 65,536 tokens(64K),支持文本、图像、音频、视频、PDF 多模态输入。 本攻…
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。 核心论文:"Addressing the Orchestration Gap in Generalist Robots via…
本攻略核验了所有数字与说法:准确率来自 ExtractBench 官方论文(arXiv:2607.29677)及 GitHub README;FTX 矩阵案例来自 Jerry Liu 原文;各 tier 定价来自 ExtractBench GitHub 页;与原帖说法一致处直接引用,与官方文档冲突处以官方为准并注明。 LlamaExtract Agentic…
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LFM2.52.6B 是 Liquid AI 在 2026 年 8 月初开源的一个 2.6B 参数端侧 Agent 模型,DeepSeekV4Flash0731 是 DeepSeek 同月发布的一个 284B 总参数 / 13B 激活参数 MoE 推理优化模型(20260731 发布)。2026 年 8 月 6 日,atomic.chat 在 4× RTX …
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
appledocsmcp 是一个 MCP 服务器,为 AI 助手提供 Apple 官方开发者文档的实时查询能力。接入后,可以在 Claude、Cursor、VS Code(Copilot MCP)、Windsurf、Zed、Cline、Amazon Q 等主流 AI 开发工具中,直接用自然语言搜索 iOS / macOS / watchOS / tvOS /…
geminimcptool 是一个 MCP(Model Context Protocol)服务器,它让 AI 助手(如 Claude Code)能够直接调用 Google Gemini CLI 的强大分析能力,对大文件、代码库进行深度理解与问答。本质上是一个桥接层:AI 助手通过 MCP 协议把文件路径和自然语言指令发送给 Gemini CLI,利用 Gem…
DSH Desktop 是 DeepSeek Harness 的跨平台桌面包装器(Electron),把本地运行的 DeepSeek Harness Web UI 封装为 macOS / Windows 原生桌面应用,让用户无需手动启动 CLI、无需管理本地端口,在桌面窗口中直接使用完整的 Harness Agent Runtime 体验。 本质上是一个 E…
Open Paper 是一个研究文献管理工作台,定位为"读论文的 IDE"。核心功能是把 PDF 上传、AI 生成摘要、highlight 标注、AI 问答、跨文献综合、Zotero 同步全部收敛到一个 Web 应用里,AI 回答强制附带可点击溯源的精确引用(citationgrounded),并配套专门的 ResearchQA 基准 来量化回答质量。 读论…
Moli 是一个用 Rust 从零构建的浏览器引擎,专为 AI Agent 场景设计。它不依赖 Chromium,却又完整实现了 V8 JavaScript 引擎、原生 DOM、CSS 渲染、网络请求(Fetch/XHR/WebSocket)、Cookie、localStorage/IndexedDB/OPFS 等 Web 运行时。与传统浏览器自动化工具最大…
2026 年,AI 社区出现了一个重要认知转向:Agent 的表现瓶颈不在模型本身,而在包裹模型的那层工程结构——Harness(驾驭层)。Harness 由 @omarsar0(Elvis,研究机构 DAIR.AI 联合创始人)提出,核心主张是:Agent 的工具调用行为由 Harness 决定,而非工具数量;Harness 的核心能力是决定何时不调用工具…
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
一个 Claude Code Skill(方法论 + 配套脚本集),专注于"忠实复刻任意网站"——从单文件静态页到 WebGL 重前端,不靠 AI 臆测代码,全部走真源码逆向。 核心理念:AI 分析文档里的代码块,默认全是臆造的,必须用真源码逐行核对。作者用一个具体案例说明:一份 AI 分析把"光线球体解析交点 + SVG feDisplacementMap…
@omarsar0 在 2026 年 8 月初发帖指出:"Token efficiency on these models are underestimated"——DeepSeek V4Flash 每 token 价格之低掩盖了一个关键事实:单任务总成本(pertask cost)并不等同于每 token 单价(pertoken price)。当模型为完成…
khazixskills 是「数字生命卡兹克」作者开源的一套 AI Agent Skills 合集,遵循 Agent Skills 开放标准,可直接被 Claude Code、Codex、Qoder、Kimi Code、iFlow、CodeBuddy、Cursor 等 40+ 支持该标准的 Agent 安装加载。每个 Skill 都是一段结构化指令集,让 A…
2026 年 7 月,LlamaIndex CEO Jerry Liu 在 VentureBeat Beyond the Pilot podcast 中抛出了一个在 AI 圈引发广泛讨论的论断:"也许 2026 年唯一的护城河就是 context 层(Context is the Moat)"。 他的核心主张是:过去几年 AI 开发者用来构建 LLM 应用的…
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
LlamaParse 是 LlamaIndex 出品的专业文档解析服务,支持 PDF、PowerPoint、Excel 等格式,输出结构化 Markdown。Cost Optimizer(成本优化器) 是 LlamaParse 的一项智能路由功能:它自动判断每个页面是"简单页"(纯文本、单栏、无图表)还是"复杂页"(表格、图表、多栏、扫描件),然后把简单页路…
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
Liquid AI 在 2026 年 7 月公开了一套原地词表扩充(Tokenizer Expansion)配方,将已训练好的 LFM28BA1B 模型的 BPE 分词器从 65,536 词扩充到 128,000 词,全程无需从头重训,最终产出 LFM2.58BA1B 模型。 核心思路:把新词表设计为旧词表的确定性扩展——每个新 token 都能拆解为一个或…