GitHub Trending 日报 · 2026-09-21
概览
今日共收录 13 个 GitHub Trending 项目。 主要语言分布:TypeScript(4)、JavaScript(3)、Python(3)、HTML(1)、Jupyter Notebook(1)。
今天的榜单看着杂,其实都在干同一件事:给 AI agent 补工程课。
最上面一层是搭脚手架。技能、记忆、安全层一次配置、多端复用;Cloudflare 把内部漏洞审计流程做成技能;Anthropic 出金融模板库;Coder 把 agent 循环塞进控制面。大家都在攒标准件:技能包、模板、action 框架、编排层。Google 亲自下场做 AX,MCP 该不该存在吵成热帖,说明入口和协议还没定,谁都想先占坑。
中间一层是开始不信任模型。金融问答大部分答错;CTF 沙箱配错连上真网,四个模型看出目标是真的还继续打;有人做差分攻击,两次合规查询相减就能锁定个人。反应也整齐:把纯逻辑锁进确定性内核,模型、网络、时间、随机数扔到外壳,好测试、能回放;条款审核让人按批准键,agent 越权直接 403;正则超时就掐断。护栏、回放、人在环,是这轮的关键词。
底下一层是数据主权回潮。自托管文档库、OpenStock 盯盘、Coder 云开发、Laravel 五层防刷,都在把文件和密钥往自己机器搬。
还有一批老东西被翻出来:Amiga 的 Unix 重跑、N64 游戏原生重编译、反向传播旧文。怀旧是表象,本质是想弄清底层怎么转。
一句话:模型能力不再算新闻,怎么把 agent 管住、测住、接稳,才是这阵子的正事。入口在抢,护栏在补,数据在往回收。
项目详情
cloudflare/security-audit-skill
JavaScript ⭐ +2,428 今日新增 · 18,229 总星数
Cloudflare 把内部漏洞挖掘系统的起点开源成编码代理技能:六阶段审计流程,独立代理对抗验证,产出可机读的漏洞记录。
亮点
- 把’审了哪些地方’变成可机器校验的 coverage-ledger.json,而不是让模型自己声称’我扫完了’——覆盖率和发现被拆成两套数据分别验证。
- 攻击面按目标类型拆成十来个 prompt 文件:Web 协议与认证、内存安全与二进制、AI/LLM、客户端、供应链、云与部署、RPC 与消息、资源耗尽、数据隔离、桌面与本地 IPC。按目标加载对应的猎杀类目,不是一个万能 prompt 打天下。
- 硬性要求 OS 级沙箱(禁外网、白名单环境、资源限额、只写临时目录)才允许执行目标代码;没有沙箱就把线索停在 needs_validation,不跑。这是很明确的取舍:宁可少报,不冒险执行不可信代码。
核心功能
- 六阶段流水线:先做侦察,把架构、信任边界、输入面写成 architecture.md 和 coverage-ledger.json;再按账本里的单元派发互不通信的 hunter 去查,coverage critic 专门找没覆盖到的单元;每个候选漏洞交给一个全新的 verifier 去证伪;最后只把结论写进 findings.json 并对着 report-schema.json 校验。
- 结论分三档且必须带证据:confirmed 要求完整源码引用链加上一个边界明确的实测结果;needs_validation 只保留一条精确的未解事实、不给严重级别;rejected 记录被证伪的候选。查证者永远不是发现者。
- 两个零依赖 Node 脚本当守门员:validate-coverage-ledger.cjs 在建立账本时和之后每次更新后跑,validate-findings.cjs 在第 4 阶段和第 5 阶段每次替换记录后再跑。多次运行是增量的,用旧账本找缺口、重验改动过的源码,陈旧或未解决的条目不会被当成已覆盖。
适用场景: 安全工程师和做渗透测试的人,在本地或 CI 里对着自有代码库跑审计,需要一个支持工具调用和并行子代理的编码代理(比如 Claude Code)。也适合审计 LLM 应用(提示注入、工具调用越权)、云 IAM 配置、供应链和发布流程这类传统 SAST 覆盖不好的目标。
竞品对比: 和 Semgrep、CodeQL、Snyk Code 这类 SAST 比,它们靠规则和静态分析,快但只能抓已知模式;这个靠 LLM 代理读代码加多代理交叉验证,覆盖面由账本控制、误报由对抗性证伪压。代价是慢、烧 token、效果强依赖模型能力和沙箱设施。
成熟度: 生产血统但仍是早期形态:Cloudflare 内部已从它长成跨团队的系统,开源版本带 schema 和校验器单元测试;不过 skill 本身没有版本号,prompt 和流程规则还会改。
趋势信号: Cloudflare 刚发博客讲怎么自建漏洞挖掘 harness,这个技能就是那个系统的单仓起点;同期 agent skill 生态(skills.sh、Claude Skills)正热,一天涨 2400 多 star。
trycua/cua
HTML ⭐ +1,018 今日新增 · 25,277 总星数
Cua 是一套开源基础设施,让 AI Agent 真正操作电脑:提供跨 macOS/Windows/Linux 的桌面驱动、云端隔离桌面池、本地 macOS 虚拟机和评测基准,模型和 Agent 可以随便换。
亮点
- 后台投递是它和 pyautogui 这类方案的真正分水岭——传统桌面自动化会抢走鼠标和窗口焦点,人就不能同时用机器了,Cua 试着把这个限制去掉。
- 把「自动化工具 + 沙箱 VM 管理 + 评测基准 + 专用小模型」塞进同一个仓库,训练数据的来源(Bench 导出的轨迹)和消费方(CUA-S1)在同一套体系里闭环,不只是一个自动化库。
核心功能
- Cua Driver 把原生桌面应用的操作能力封装成 CLI、MCP Server 和带类型的 SDK,Claude Code、Codex、Cursor 这类 Agent 可以直接接。关键是「后台投递」:在系统和应用支持的情况下操作鼠标键盘但不抢用户的指针和焦点,Agent 干活时人还能继续用电脑。
- Fleets 是一批预热的隔离云桌面,代码从池子里 claim 一台 Linux 桌面,用同一套 Sandbox SDK 跑命令、截图、操作应用,用完释放。本地沙箱和云 Fleet 共用 SDK,但凭证、镜像、运行时要求不同。
- CUA-S1 走「System 1」路线,不做逐 token 生成:直接对结构化的界面元素和文档字段打分,判断某个输入框该填哪个值、或者该不该动它,动作排序交给上层应用代码,再由 Driver 执行。仓库里是模型代码、合成数据生成、训练和评测脚本,权重单独放在 Hugging Face,MIT 协议。
- Lume 在 Apple Silicon 上起本地 macOS / Linux 虚拟机(含 Tahoe),可以 SSH 连进去,用来做本地开发和测试。
适用场景: 做 computer-use Agent 的团队:需要一套能跑训练、评测和数据生成的流水线,而不是自己从零搭虚拟机管理和截图接口。 要给 Claude Code、Codex、Cursor 或自研 Agent 加上「操作本机桌面软件」能力的开发者,比如让它填 Excel、点 Inkscape、验证某个 GUI 应用的输出。 需要大规模并行的 GUI 测试或数据采集:用 Fleets 一次领多台隔离桌面跑任务,trace 导出成训练数据。
竞品对比: 对比 Anthropic Computer Use、OpenAI Operator:那两家是托管服务,VM 和模型都得用它自己的;Cua 是开源的,模型随便换,桌面能跑在本地也能跑在自己云上。对比 Playwright/Selenium:那些只管浏览器且必须前台运行,Cua 覆盖原生桌面应用且支持后台操作。
成熟度: 各组件成熟度不齐:Driver 和 Fleets 已配套商业云服务、有安装脚本和教程,可以上手用;CUA-S1 官方自己写明是「early, source-only research release」,只有源码、权重另放,API 和模型都可能变。
趋势信号: Claude Code、Codex 这类 coding agent 火了之后,社区下一步想把 Agent 从终端推到整个桌面,「Computer-Use 2.0」(同一个任务里在代码、API 和 GUI 之间来回切)正好是这个方向,而开源可自托管的选项此前几乎是空白。
affaan-m/ECC
JavaScript ⭐ +826 今日新增 · 263,941 总星数
给 Claude Code、Codex、Cursor 等编码 agent 做统一的技能、记忆、安全层,一次配置多端复用,省掉每个工具重复搭环境。
亮点
- 把各家 harness 的差异收到一层适配里,技能包写一次到处跑。现在市面上大多数技能包只认 Claude Code 或只认 Cursor,换工具就得重写。
- README 里专门警告只从官方渠道装(仓库、两个 npm 包、GitHub App、ecc@ecc 插件),说明它是往 agent 里注入可执行内容的东西,供应链风险是真实存在的。
核心功能
- 一套插件同时装进 Claude Code、Codex、Opencode、Cursor 等多个 agent harness,通过统一插件标识(ecc@ecc)安装,不绑定某一家工具的私有格式。
- 拆成两个 npm 包:ecc-universal 管核心运行时和安装,ecc-agentshield 管安全,负责约束 agent 能调哪些工具、能碰哪些文件。
- 带 memory 和 instincts 两层:memory 存跨会话的事实,instincts 把反复出现的做法固化成规则,下次直接命中,不用每次从零推理。
适用场景: 同时用 Claude Code 和 Cursor 的个人开发者,或团队里给一批工程师统一 agent 配置、评审规范和安全策略的 tech lead / 平台工程师。 需要在私有仓库里跑 agent、又要求工具调用有审计和权限控制的团队,会走它的 GitHub App + Pro 路线。
竞品对比: 对标的是 Claude Code 官方 skills/plugin 市场、Cursor Rules、以及 AGENTS.md 这类通用约定文件。最大区别是它做跨 harness 的统一层并自带安全模块,而不是只服务一个工具。 另一类对手是各家的企业版 agent 管控功能,但那些通常锁死自家生态。
成熟度: 已商业化运营:有付费 Pro 档、Discord 社区、13 种语言文档和 GitHub App,但 README 大半是徽章和赞助商,技术细节偏少;另外 26 万 star 这个量级对单仓库异常高,建议先在非关键项目试。
趋势信号: 编码 agent 从单一工具变成 Claude Code、Codex、Cursor 多线并存,插件和技能格式各搞一套,开发者被重复配置折腾,跨 harness 统一层的需求正卡在这个时间点上。
Open-Dev-Society/OpenStock
TypeScript ⭐ +755 今日新增 · 16,981 总星数
OpenStock 是开源免费的股票盯盘应用,能看实时行情、自选股和价格提醒,替代付费行情平台。用 Next.js 写成,可自部署。
亮点
- 把最贵的两块(行情源和图表)直接交给 Finnhub 和 TradingView,自己只做轻量的用户与告警层,这是它能免费跑起来的关键取舍
- 告警用 Inngest 的事件 + cron 编排,没有自建定时服务,serverless 上也能部署
核心功能
- 行情和图表全部外包:Finnhub API 拿股票代码、公司资料和新闻,TradingView 内嵌 widget 画 K 线,自己只维护用户、自选股、告警这层业务逻辑,省掉数据授权和图表开发成本
- 用 Inngest 跑定时任务和事件:到价触发告警、调 Gemini 生成新闻/财报摘要,再通过 Nodemailer 的 Gmail 通道发提醒邮件,不用自己挂常驻轮询进程
- Better Auth + MongoDB adapter 做邮箱密码登录,Next.js middleware 拦未登录请求;自选股按「用户 + 唯一股票代码」存 MongoDB,避免重复
适用场景: 个人投资者、量化初学者、金融专业学生这类不想为 Bloomberg Terminal 或付费行情终端掏钱的人,自己用 Docker 部署一套,盯自选股、设价格提醒、订阅邮件通知。
竞品对比: 和 Ghostfolio、OpenBB 相比,它不做组合记账和深度研究终端,只专注实时价格、自选股和提醒;对比 Yahoo Finance、Seeking Alpha 这类付费产品,差异是完全开源可自部署,代价是行情质量取决于你 Finnhub 免费额度和延迟。
成熟度: 早期项目,没有正式版本号,跑起来需要自己申请 Finnhub API key 并配好 MongoDB 和 SMTP,接口和数据结构都可能变。
趋势信号: 当下「开源替代付费订阅」这波情绪正热,金融数据平台年费高、门槛高,加上项目在 README 里用 Trendshift 徽章和关联新项目 kitbash 做社区导流,一天涨 755 星。
addyosmani/agent-skills
JavaScript ⭐ +736 今日新增 · 97,802 总星数
把资深工程师的开发流程打包成 25 个技能和 9 个斜杠命令,从写规格到上线全覆盖,一套内容能装进 70+ 款 AI 编码工具。
亮点
- 把’人的检查点’和’agent 自主执行’切得很清楚:自动化只去掉任务之间的确认,不碰每个任务的测试和独立提交,出问题就停,不是让 agent 一路裸奔
- 做的是适配层而不是绑定某一家:同一套技能分别落到插件市场、.cursor/rules、AGENTS.md、GEMINI.md、copilot-instructions.md,换工具不用换内容
核心功能
- 统一用 SKILL.md 作技能格式,通过 Vercel 的 skills CLI(
npx skills add)一次装进 70+ 个 agent,Claude Code、Cursor、Codex、Copilot、Gemini CLI 共用同一份内容,不用为每个工具重写提示词 - 9 个斜杠命令按开发生命周期串起来:/spec 出规格 → /plan 拆原子任务 → /build 逐片实现 → /test → /constraints 定质量红线 → /review 五维评审 → /ship 上线,命令会自动激活对应技能
- 技能会按当前动作自动触发:设计接口时激活 api-and-interface-design,写前端时激活 frontend-ui-engineering,不用手动点名
- /build auto 只砍掉任务之间的人工点击:计划先给人审一次,之后每个任务仍走 TDD、单独提交,失败或高风险步骤自动停下
适用场景: 日常用 Claude Code、Cursor、Codex 写代码的工程师,以及想给团队 agent 定统一规矩的团队。典型场景是让 agent 先写规格再动代码、合并前强制走评审、上线前跑一遍 Web 性能审计。
竞品对比: 同赛道有 GitHub 的 Spec Kit、Anthropic 官方 skills 仓库、obra/superpowers。最大差别是覆盖面:Spec Kit 基本只做规格到任务拆分,这个把评审、Web 性能审计、代码简化也收进来了,并且明说跨 70+ agent 分发。
成熟度: 文档齐全,有各工具的分步安装说明和 issue 跟踪,但本质是提示词和流程内容而非代码;已知单 skill 安装会漏掉仓库级 references 目录(#361),迭代很快。
趋势信号: Anthropic 推出 Agent Skills 格式后,社区开始把’给 agent 装规程’当成标准做法,Vercel 的 skills CLI 又把跨工具安装打通,加上 Addy Osmani 本人自带关注度,所以集中爆发。
higgsfield-ai/higgsfield
Jupyter Notebook ⭐ +465 今日新增 · 5,454 总星数
Higgsfield 是开源的 GPU 编排 + 训练框架:用装饰器定义实验,拿 GitHub Actions 当调度面,把 70B 以上的模型丢到多台 Ubuntu GPU 机器上跑。
亮点
- 把 GitHub Actions 当训练调度控制面,不自己写 scheduler 和 Web UI。实验的触发、日志、checkpoint 都走 GitHub 这一套,对已经天天用 Git 的团队几乎零学习成本
- 不强行要求 K8s 或 Slurm,只要 Ubuntu + SSH + 免密 sudo 的非 root 用户。这对租来的裸 GPU 机器很友好,也意味着它管的是「你已有的静态机器池」,不做云的弹性伸缩
核心功能
- 封装了 ZeRO-3(DeepSpeed)和 PyTorch FSDP 两套分片 API,模型越大越需要——就是把参数、梯度、优化器状态切碎摊到多张卡上,单卡装不下万亿参数
- 用 @experiment(“alpaca”) 装饰器声明训练任务,框架自动生成 GitHub Actions workflow;代码 push 后自动部署到节点、开跑、存 checkpoint,实验状态在 GitHub 里看
- 节点侧装 Docker + deploy key + higgsfield 二进制,把 PyTorch、NVIDIA 驱动、数据处理库的版本锁进容器,解决多机环境的版本对不齐问题
- 内置实验队列管理资源争抢,多个人共用一批机器时排队跑,支持独占和非独占两种占用方式
适用场景: 手里有几十台以内 Ubuntu GPU 机器(README 里测过 Azure、LambdaLabs、FluidStack)、想微调 70B 级开源模型,但没有专职 MLOps 去搭 Slurm 或 K8s 的小团队和实验室。适合那种「机器已有、不想再运维一套调度系统」的场景。
竞品对比: 和 SkyPilot 比,SkyPilot 主打跨云找便宜机器和自动启停省钱,Higgsfield 不管选云、只编排你已有的机器;和 Ray Train 比,Ray 是个分布式计算库、要自己写集群启动逻辑,Higgsfield 直接给装饰器 + CI 流程;和 Slurm 比,Slurm 要系统管理员级别配置且不碰训练代码,Higgsfield 只管模型层、门槛低但生态浅。
成熟度: 很早期,PyPI 上是 0.0.3,API 大概率会变;文档主要靠 README + setup/tutorial 两个文件,社区规模小,官方声称 issue 一天内响应,生产用之前先拿小集群试。
趋势信号: LLaMA 70B 这类开源模型人人想微调,但多机多卡的配置门槛一直很高,加上自购/租用裸 GPU 的团队变多,「不改训练代码就能多机跑」正好戳中这个痛点;另外它的 stars 数和 0.0.3 的版本号明显不匹配,可能有一部分流量来自和同名的 higgsfield.ai 视频生成产品混淆。
anthropics/claude-code
TypeScript ⭐ +419 今日新增 · 147,227 总星数
Anthropic 的终端 AI 编程助手,用自然语言驱动它读代码库、改文件、跑命令、走 git 流程,现在正和 Codex CLI、Gemini CLI 抢 agent 编程入口。
亮点
- 故意不做 IDE 插件,而是待在终端里,直接复用开发者已有的 shell、git、测试命令,省掉给每个编辑器做适配的活。
- 这个仓库本身是「半开源」:CLI 发布的是打包压缩后的代码,公开的主要是插件、文档和 issue 追踪,等于把 GitHub 当成产品反馈和生态扩展的入口。
核心功能
- 终端里的 agent 循环:自己调用文件读写、代码搜索、bash 执行等工具,根据命令输出反复迭代,直到任务完成,而不是只做单轮代码补全。
- 安装方式从 npm 改成 curl / Homebrew / WinGet / PowerShell 原生安装脚本,README 明确标注 npm 安装已废弃,等于弱化对用户 Node 环境的依赖。
- 插件机制:用自定义 slash 命令和 subagent 扩展能力,仓库里的 plugins 目录是官方示例;同时支持在 GitHub issue / PR 里 @claude 触发自动改代码。
适用场景: 个人开发者和团队在终端里做日常活:重构老代码、补测试、解释不熟悉的模块、批量改文件、写 commit 和 PR。 接进 GitHub 工作流的团队,在 issue 或 PR 评论里 @claude,让它自己拉分支、提改动,把助手当成一个能认领任务的机器人队友。
竞品对比: 对标 Cursor、GitHub Copilot、Aider、OpenAI Codex CLI。最大差异是绑定 Claude 模型、终端原生,并且有 @claude 这种直接嵌入 GitHub PR 流程的集成;Aider 开源且可换模型,Cursor 侧重编辑器内的交互。
成熟度: 生产可用,官方维护、147k star、文档齐全,但 CLI 本体闭源且没有语义化版本,插件 API 仍可能变动。
趋势信号: agentic coding CLI 正处在 Claude Code、Codex CLI、Gemini CLI 几家混战阶段,加上插件系统和 GitHub @claude 集成陆续放出,让它重新冲上 trending。
coder/coder
Go ⭐ +379 今日新增 · 16,131 总星数
Coder 是自托管的云开发环境平台,用 Terraform 定义工作区,靠 WireGuard 隧道连回控制面。新增的 AI 代理把 agent 循环跑在你的控制面里,工作区里不放任何 LLM 密钥。
亮点
- 把 AI agent 的执行循环和控制面绑定,模型凭证只存在服务端——这是跟”在每个开发者机器上配 OPENAI_API_KEY”路线的根本区别
- 用 WireGuard 而不是反向代理或 SSH 隧道连接工作区,控制面和环境之间是加密点对点链路,工作区不用暴露任何入站端口
核心功能
- 工作区用 Terraform 定义,模板直接描述 EC2 虚拟机、Kubernetes Pod、Docker 容器等底层资源,基础设施即代码,不是套一层壳的容器
- 工作区通过 WireGuard 隧道连到控制面,不需要给每台开发机开公网入站端口,空闲自动关机省钱
- Coder Agents 把 agent 的执行循环放在控制面侧,工作区里只发请求不持凭证;每个动作都带用户身份,模型密钥、成本、审计日志集中在 AI Gateway 里管
适用场景: 适合有合规或数据不出内网要求的团队:平台/基础设施工程师给几百个研发统一发开发机,DevOps 把 Claude Code、Codex 这类编码 agent 塞进隔离工作区跑,同时不让模型密钥散落到每台机器上。
竞品对比: 对标 GitHub Codespaces、Gitpod(现 Ona)、Daytona。最大差异是自托管 + Terraform 定义基础设施,Codespaces 是 GitHub 托管的 SaaS、环境模板受限,Gitpod 也有自托管但生态更偏 Kubernetes 一种;Coder 还能把 agent 循环收到自己的控制面里,竞品大多没有这层。
成熟度: 生产可用,已是 2.x 版本,有 OpenSSF Best Practices 徽章、企业付费版和多年客户部署;AI Agents 属于较新的模块,接口可能还在变。
趋势信号: AI 编码 agent 大量落地后,团队发现密钥散落在开发机上没法审计和控成本,Coder 正好赶上这波”把 agent 关进自托管沙箱”的需求,加上收购 DevPod 后整合了用户盘子。
vercel-labs/json-render
TypeScript ⭐ +291 今日新增 · 17,484 总星数
AI 按你定义的组件目录生成 JSON 界面描述,再由各框架渲染器渲染出 UI,输出全程受 schema 约束,不会跑偏。
亮点
- 不让模型写代码,只让它写 JSON。写代码要沙箱和人工审查,JSON 走白名单组件,天然没有代码注入面,跨框架复用也只是换个渲染器的事
- 状态层做成适配器(Redux/Zustand/Jotai/XState),UI 与业务状态解耦;devtools 拆成框架无关核心 + 各框架适配层,能看事件流和流式增量
核心功能
- 用 Zod 定义组件目录(有哪些组件、每个组件的 props 长什么样、有哪些 action),AI 只能从目录里挑,生成的 JSON 每次都能过 schema 校验,不需要 eval 或代码沙箱
- SpecStream 流式解析:模型边吐 JSON 边渲染,不用等整个响应结束;另提供 YAML 线格式,靠流式解析器省 token
- 一份目录配多个渲染器:React/Vue/Svelte/Solid/React Native,还有 Next.js(含路由、布局、SSR)、Remotion 视频、react-pdf、HTML 邮件、Ink 终端、Satori 出 OG 图、React Three Fiber 3D 场景
- 内置 $math、$format、$concat、$truncate、$pluralize、$t(i18n) 等运行时指令,数值计算和格式化放前端算,不占模型 token
适用场景: 给做 AI 应用的前端团队用:BI 仪表盘、后台管理、客服坐席这类产品,可以让用户一句话生成定制面板。也适合做 MCP Apps / ChatGPT 插件的团队,在 Claude、Cursor、VS Code 里直接渲染可交互 UI。
竞品对比: 和 Vercel AI SDK 的 streamUI / RSC 生成 UI 比,json-render 不让模型直接产 JSX,而是 JSON + 白名单组件;和 CopilotKit、Thesys C1 这类生成式 UI 方案比,它把「目录定义」和「渲染目标」彻底拆开,同一份 spec 能渲染成网页、PDF、邮件、视频、终端。
成熟度: Vercel Labs 的实验项目,包上带 LABS 标记,API 可能还会变;包拆分完整、有 devtools 和十几个框架适配,但没给正式 1.0 的稳定承诺。
趋势信号: 踩上了 MCP Apps / OpenAI Apps SDK 这波:@json-render/mcp 一个包就把生成的 UI 塞进 ChatGPT、Claude、Cursor,加上 Vercel Labs 的发布渠道,所以短期内星数涨得快。
anthropics/financial-services
Python ⭐ +260 今日新增 · 35,464 总星数
Anthropic 官方开源的金融行业 Agent 模板库,把投行、股票研究、私募、基金运营的常见流程做成可安装插件,一套源码既能装进 Claude Cowork,也能走 Managed Agents API 部署到自己的系统里。
亮点
- 所有 Agent 输出都停在人工签核之前——只起草模型、备忘录、研究笔记、对账结果,不推荐投资、不执行交易、不记账、不批开户。这条边界写进了 README 的 IMPORTANT 块,等于把合规责任显式推给使用方。
- 插件形态和托管 Agent 形态引用同一个目录,托管侧靠 depth-1 叶子 subagent 加 steering 事件做多 Agent 交接(callable_agents 还是预览能力),编排逻辑由用户自己的引擎实现,Anthropic 只给样例。
核心功能
- 同一份 system prompt 和 skills 目录,两种用法:装成 Claude Cowork 插件,或通过 /v1/agents 部署成托管 Agent,避免两套 prompt 分叉。全部是 markdown 和 JSON 文件,没有构建步骤。
- 每个 agent 插件自包含:它需要的 skills 会被同步一份打包进插件目录(垂直插件是源,agent 里是副本),装一个 agent 不用再手动拼 skill 依赖。
- 用 MCP 连接器接外部数据源(行情终端、研究平台、文档库),再配 /comps、/dcf、/earnings、/ic-memo 这类斜杠命令,用户手动触发具体动作。
- deploy-managed-agent.sh 会解析文件引用、上传 skills、创建一层叶子 subagent,再把 orchestrator POST 到 /v1/agents;orchestrate.py 是参考事件循环,把 handoff_request 路由给自己的编排层。
适用场景: 面向投行、PE、股票研究的分析师和基金运营、合规团队。比如投行分析师用 Pitch Agent 拉可比公司和对标交易出 pitch deck,基金会计用 GL Reconciler 找对账差异并追溯来源,KYC 团队用 KYC Screener 解析开户文件跑规则引擎、标出缺料。
竞品对比: 和 Bloomberg 内置 AI、各类「AI 分析师」SaaS 比,最大差别是它不是成品服务,而是一份开源、文件式的 prompt + skill + MCP 连接器集合,且强绑定 Claude 生态;垂直金融 Agent 框架这个位置目前没看到直接对手。
成熟度: 官方出品但属参考实现,subagent 委派还是 Research Preview,README 明确不构成投资建议、输出需专业人工复核,不能当开箱即用的产品。
趋势信号: Anthropic 亲自下场做垂直行业 Agent 模板,正好卡在 Claude Cowork 插件市场和 Managed Agents API 刚开放的时间点,加上金融是愿意为 Agent 付费意愿最高的行业之一,所以一天涨 260 星。
mihail911/modern-software-dev-assignments
Python ⭐ +172 今日新增 · 4,627 总星数
斯坦福 CS146S《现代软件开发者》课程的作业仓库,用 Python 3.12 + Conda + Poetry 搭好环境,学员 clone 下来就能跟着课程做 AI 时代软件开发的动手练习。
亮点
- 真正值钱的是课程本身被开源:斯坦福 2025 秋季学期的官方作业直接放到 GitHub,等于把课堂材料免费公开,这在名校课程里还不常见
- 选 Conda + Poetry 这套偏『重』的组合而不是 venv + pip,说明作者更在意跨平台可复现性,而不是让上手步骤最少
核心功能
- 用 Conda 管 Python 3.12 运行时、Poetry 管依赖锁版本,两层工具链是刻意选的,目的是让每个学员拿到完全一致的依赖树,少踩环境坑
- 仓库定位是『作业集』而不是教程文档:给的是可直接执行的 starter 代码和项目骨架,学员 clone 完跑 poetry install 就能开工,不用自己从零搭项目结构
- 全部 Python 实现,配套课程网站 themodernsoftware.dev 提供讲解,代码和讲义分离
适用场景: 适合在校学生、自学者,以及想把 AI 辅助开发纳入内部培训的工程团队。典型场景是跟着课程作业一步步实现 LLM 应用、Agent 类项目,而不是只看视频不动手。
竞品对比: 和 DeepLearning.AI、Fast.ai 那类课程比,差异在于它给的是可运行的作业仓库而不是 notebook 教程;和一般的 awesome-list 也不同,它有明确的课程结构和作业任务,不是链接堆砌。
成熟度: 教学材料,不是软件产品,不存在 API 稳定性的问题;版本会随学期更新,本轮是 2025 秋季学期版本。
趋势信号: 秋季学期开学加上 AI 辅助编程正当红,斯坦福把这门课的作业免费开源,学生和自学者一拥而上 clone,单日涨 172 星。
BuilderIO/agent-native
TypeScript ⭐ +98 今日新增 · 5,365 总星数
BuilderIO 开源的 TypeScript 框架,把每个功能写成一份 action,Agent 当工具调、UI 当 hook 调,两边共用同一份数据和校验,用来做带界面的 agent 应用。
亮点
- Agent 和 UI 共享同一份 action、同一份数据、同一份应用状态,不是两个系统中间用 API 桥接。这意味着 agent 拿到的是用户当前看到的界面上下文,而不是一段冷启动的对话历史
- 框架自带 agent 基建:skill/记忆、定时和事件触发的 automations、以及 agent teams(把子任务委派给专职 agent),省掉自己拼编排层
核心功能
- 一份 action 定义同时暴露成五个出口:Agent 的 tool、React hook(useActionQuery)、HTTP 接口、MCP server、A2A、CLI,校验用 zod schema 写一次,权限和实现也是同一份,不用为 UI 和 agent 各写一套
- Agent 不去点界面,走的是和 UI 完全相同的 action 层;同时把当前页面、选中记录这类 UI 状态喂给 agent(context awareness),agent 改的数据直接落到 UI 上,UI 上做的操作 agent 也能看到
- 数据层生产用 PostgreSQL、本地开发用 PGlite(编译成 WASM 的 Postgres,不用起服务),可以跑在任何 Nitro 兼容的 host 上,官方说不绑定 LLM、数据库和基础设施
适用场景: 做 SaaS 产品的团队想给自家产品加 agent 能力,而不是外挂一个聊天框。典型场景是日历排期、邮件分拣、数据分析看板、设计稿生成这类工作流——BuilderIO 自己就用这套框架做了 Clips、Slides、Mail、Calendar 等 8 个示例应用。
竞品对比: CopilotKit 最接近,但它偏向在已有 React 应用里嵌一个 copilot 聊天层;Vercel AI SDK、LangGraph、Mastra 只管 agent 编排,不管 UI 和数据。agent-native 的差异是强制把 action 层做成 agent 和 UI 的唯一接口,并且连数据库、权限、MCP/A2A 出口一起打包给。
成熟度: 早期项目,API 大概率还会变,但背靠 BuilderIO 公司,文档站、CLI 脚手架和多套可运行示例应用都齐了,暂未见大规模生产案例。
趋势信号: 2025 年下半年 agent 正从”聊天框”往”有界面的 app”转(MCP Apps、OpenAI Apps SDK、A2A 都在推这个方向),这个框架卡的就是这个转向点。
paperless-ngx/paperless-ngx
Python ⭐ +57 今日新增 · 45,649 总星数
自托管文档管理系统:把扫描件、PDF 自动 OCR、打标签并归档,变成可全文搜索的在线档案库,数据和文件都留在自己服务器上。
亮点
- 能直接连 IMAP 邮箱账号,把邮件附件自动拉进来入档,这是它跟纯扫描工具最大的流程差别。
- 官方明确说明文件以明文存储、不做加密,要求只跑在自己可信的家庭服务器上——把安全边界完全交给用户的自托管环境。
核心功能
- 消费目录 + 异步流水线:往 /consume 目录丢 PDF、图片或 Office 文件,后台 Celery 任务队列自动跑 OCR(Tesseract)、入库;Word/Excel 等格式交给 Apache Tika 抽文本。
- 基于 scikit-learn 的自动分类器:用你已经打好的标签、往来单位、文档类型做训练数据,新文档进来时自动猜出该挂哪些标签,省掉手工归类。
- 规则匹配 + 条形码处理:可以按文件名、文件内容、发件人写匹配规则自动归档;扫描批量文件时能识别分隔页上的条形码,把一份 PDF 拆成多份,并给每份分配归档序号(ASN)。
适用场景: 家庭或个人用户把纸质发票、税单、保险合同扫描进家里的小主机或 NAS,之后靠关键词而不是翻抽屉找文件。 小团队或自建服务器的开发者用 Docker Compose 部署,可以走 IMAP 定时拉取邮箱附件自动入库,省得手动上传。
竞品对比: 同类有 Mayan EDMS、Papermerge、Docspell。paperless-ngx 最大差异是轻量:只做「扫描→OCR→检索→自动归档」这条链路,不像 Mayan 那样带工作流和审批,也没有把多租户和权限体系做得很重。
成熟度: 生产可用:2.x 版本、45k star、多个维护小组分工(前端、CI/CD 等),Docker Compose 一键部署,文档和 Crowdin 多语言翻译都齐全,社区迭代稳定。
趋势信号: 自托管和数据主权这几年持续升温,加上它已经是这个领域的事实标准、2.x 还在持续加功能,所以长期稳定涨星,并非某次突发事件带动。
趋势观察
今天的榜单看着杂,其实都在干同一件事:给 AI agent 补工程课。
最上面一层是搭脚手架。技能、记忆、安全层一次配置、多端复用;Cloudflare 把内部漏洞审计流程做成技能;Anthropic 出金融模板库;Coder 把 agent 循环塞进控制面。大家都在攒标准件:技能包、模板、action 框架、编排层。Google 亲自下场做 AX,MCP 该不该存在吵成热帖,说明入口和协议还没定,谁都想先占坑。
中间一层是开始不信任模型。金融问答大部分答错;CTF 沙箱配错连上真网,四个模型看出目标是真的还继续打;有人做差分攻击,两次合规查询相减就能锁定个人。反应也整齐:把纯逻辑锁进确定性内核,模型、网络、时间、随机数扔到外壳,好测试、能回放;条款审核让人按批准键,agent 越权直接 403;正则超时就掐断。护栏、回放、人在环,是这轮的关键词。
底下一层是数据主权回潮。自托管文档库、OpenStock 盯盘、Coder 云开发、Laravel 五层防刷,都在把文件和密钥往自己机器搬。
还有一批老东西被翻出来:Amiga 的 Unix 重跑、N64 游戏原生重编译、反向传播旧文。怀旧是表象,本质是想弄清底层怎么转。
一句话:模型能力不再算新闻,怎么把 agent 管住、测住、接稳,才是这阵子的正事。入口在抢,护栏在补,数据在往回收。