diff --git a/README.md b/README.md index a41bce3..5526944 100644 --- a/README.md +++ b/README.md @@ -258,7 +258,7 @@ Agent 领域变化很快。当前更值得投入的不是老式“角色扮演 | Concept | Learn From | What It Solves | | --- | --- | --- | | Skills | [Claude Code Skills](https://code.claude.com/docs/en/skills), [OpenClaw Skills](https://github.com/openclaw/openclaw/blob/main/docs/tools/skills.md) | 把一类任务的流程知识、脚本、模板和验收标准打包成可复用能力。 | -| MCP | [Model Context Protocol](https://modelcontextprotocol.io/) | 让 agent 标准化连接外部工具、数据源和服务。 | +| MCP | [Model Context Protocol](https://modelcontextprotocol.io/), [官方 MCP Servers 合集](https://github.com/modelcontextprotocol/servers) | 让 agent 标准化连接外部工具、数据源和服务;官方 servers 合集涵盖文件系统、数据库、搜索、浏览器等常见场景,是学 MCP 接入最直接的参考。 | | A2A | [Agent2Agent Protocol](https://a2a-protocol.org/latest/specification/) | 让不同 agent 之间发现、通信和协作。 | | ACP | [Agent Client Protocol](https://agentclientprotocol.com/) | 让编辑器、终端、IDE、宿主应用和 agent 之间形成统一接口。 | | Skill Quality | [SWE-Skills-Bench](https://arxiv.org/abs/2603.15401), [Agent Skills analysis](https://arxiv.org/abs/2602.08004) | 评估 skills 是否真的提升成功率,而不是制造新的 prompt 噪声。 | @@ -304,6 +304,9 @@ Agent 领域变化很快。当前更值得投入的不是老式“角色扮演 | [AgentBench](https://arxiv.org/abs/2308.03688) | Agent 能力评测。 | | [WebArena](https://arxiv.org/abs/2307.13854) | 真实网页环境下的 agent benchmark。 | | [SWE-bench](https://arxiv.org/abs/2310.06770) | 真实 GitHub issue 修复评测。 | +| [GAIA](https://arxiv.org/abs/2311.12983) | 通用 AI 助手基准,测推理、多模态、工具使用;人类 92% vs GPT-4 15%,差距揭示 agent 能力上限。 | +| [OSWorld](https://arxiv.org/abs/2404.07972) | 真实操作系统环境下的多模态 agent benchmark,覆盖 Ubuntu / Windows / macOS;适合 Stage 6 计算机操作 agent 学习。 | +| [τ-bench](https://arxiv.org/abs/2406.12045) | 测量 tool-agent-user 三方动态交互;GPT-4o 在真实场景成功率不足 50%,pass^8 不足 25%,是评估 agent 可靠性的重要参照。 | | [SWE-agent](https://arxiv.org/abs/2405.15793) | 软件工程 agent 的 agent-computer interface。 | | [Dive into Claude Code](https://arxiv.org/abs/2604.14228) | 从系统设计角度分析 Claude Code 这类 coding agent 的 harness、权限、压缩和扩展机制。 | | [AI Harness Engineering](https://arxiv.org/abs/2605.13357) | 把 harness 作为 agent 能力来源来研究。 | @@ -326,6 +329,8 @@ Agent 领域变化很快。当前更值得投入的不是老式“角色扮演 | [huggingface/smolagents](https://github.com/huggingface/smolagents) | 轻量 CodeAgent 风格框架,适合研究“让模型写代码执行动作”的范式。 | | [openai/codex](https://github.com/openai/codex) | OpenAI 开源 coding agent CLI,适合研究 sandbox、approval、CLI 产品形态。 | | [opencode-ai/opencode](https://github.com/opencode-ai/opencode) | 终端优先的开源 coding agent,适合对照 Claude Code / Codex。 | +| [Aider-AI/aider](https://github.com/Aider-AI/aider) | 终端 AI pair programming 工具,支持多模型,与 git 深度集成;是最早期也最活跃的 coding agent 之一,对照 Claude Code 视角学习价值高。 | +| [block/goose](https://github.com/block/goose) | Block 出品的开源可扩展 AI agent,支持安装、执行、编辑、测试,不限于代码建议;架构和 skills 设计值得研究。 | | [langchain-ai/langgraph](https://github.com/langchain-ai/langgraph) | 状态图和可控 agent 编排。 | | [openai/openai-agents-python](https://github.com/openai/openai-agents-python) | OpenAI Agents SDK Python。 | | [QwenLM/Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) | Qwen 生态 agent 框架。 | diff --git a/index.html b/index.html index b9fede2..32a7fd2 100644 --- a/index.html +++ b/index.html @@ -526,7 +526,7 @@ title:'Skills、协议与工具', rows:[ ['Skills','Claude Code Skills, OpenClaw Skills','把一类任务的流程知识、脚本、模板和验收标准打包成可复用能力。'], - ['MCP','Model Context Protocol','让 agent 标准化连接外部工具、数据源和服务。'], + ['MCP','Model Context Protocol, 官方 MCP Servers 合集','让 agent 标准化连接外部工具、数据源和服务;官方 servers 合集涵盖文件系统、数据库、搜索、浏览器等常见场景,是学 MCP 接入最直接的参考。'], ['A2A','Agent2Agent Protocol','让不同 agent 之间发现、通信和协作。'], ['ACP','Agent Client Protocol','让编辑器、终端、IDE、宿主应用和 agent 之间形成统一接口。'], ['Skill Quality','SWE-Skills-Bench, Agent Skills analysis','评估 skills 是否真的提升成功率,而不是制造新的 prompt 噪声。'] @@ -570,6 +570,9 @@ ['AgentBench','Agent 能力评测。'], ['WebArena','真实网页环境下的 agent benchmark。'], ['SWE-bench','真实 GitHub issue 修复评测。'], + ['GAIA','通用 AI 助手基准,测推理、多模态、工具使用;人类 92% vs GPT-4 15%,差距揭示 agent 能力上限。'], + ['OSWorld','真实操作系统环境下的多模态 agent benchmark,覆盖 Ubuntu / Windows / macOS;适合 Stage 6 计算机操作 agent 学习。'], + ['τ-bench','测量 tool-agent-user 三方动态交互;GPT-4o 在真实场景成功率不足 50%,pass^8 不足 25%,是评估 agent 可靠性的重要参照。'], ['SWE-agent','软件工程 agent 的 agent-computer interface。'], ['Dive into Claude Code','从系统设计角度分析 Claude Code 这类 coding agent 的 harness、权限、压缩和扩展机制。'], ['AI Harness Engineering','把 harness 作为 agent 能力来源来研究。'], @@ -592,6 +595,8 @@ ['huggingface/smolagents','轻量 CodeAgent 风格框架,适合研究"让模型写代码执行动作"的范式。'], ['openai/codex','OpenAI 开源 coding agent CLI,适合研究 sandbox、approval、CLI 产品形态。'], ['opencode-ai/opencode','终端优先的开源 coding agent,适合对照 Claude Code / Codex。'], + ['Aider-AI/aider','终端 AI pair programming 工具,支持多模型,与 git 深度集成;是最早期也最活跃的 coding agent 之一,对照 Claude Code 视角学习价值高。'], + ['block/goose','Block 出品的开源可扩展 AI agent,支持安装、执行、编辑、测试,不限于代码建议;架构和 skills 设计值得研究。'], ['langchain-ai/langgraph','状态图和可控 agent 编排。'], ['openai/openai-agents-python','OpenAI Agents SDK Python。'], ['QwenLM/Qwen-Agent','Qwen 生态 agent 框架。'],