AI Agent · DevTools Research
把 AI Agent 工具的
能力、应用与风险讲清楚
本中心整理 8 个调研对象:飞书 CLI、WiFi 感知、终端 Agent、长任务记忆、自治编码循环、互联网读取、浏览器自动化、工程化技能。每份报告按统一结构产出 —— 结论 → 核心能力 → 应用场景 → 风险与缓解 → 可追溯来源。
风险优先
Token、Cookie、Prompt Injection、供应链一项不漏。
来源可追溯
每条结论都标注 GitHub / 官网 / Release 出处。
可复验
给出复现命令、配置示例与可执行链路。
横向对比
官方版本 vs 社区版本、能力矩阵、风险等级一目了然。
01调研报告入口
大卡片为高优先级与高风险议题,小卡片为辅助专题。右下角图标表示主题类型。
自治循环
Ralph · 自治 AI agent loop
PRD → JSON 任务、fresh context 隔离、git/progress 记忆、危险权限参数与质量门禁;最具影响力,也最需要风险护栏。
Warp
Agentic Development Environment:终端、Warp Drive、Oz、开源贡献流程、许可证与云端上下文风险。
飞书 CLI 与 Claude Code
官方 larksuite/cli 与社区 riba2534/feishu-cli 对比:文档、Sheets/Base、消息卡片与 Token 风险。
Playwright MCP
结构化页面快照、网页交互、调试工具与安全边界。
Agent Reach
网页、社媒、视频、RSS、GitHub 读取与搜索工具;Cookie 与抓取合规风险。
长任务记忆
Planning with Files
持久化 Markdown 计划:task_plan / findings / progress / hooks。
WiFi 感知
RuView
WiFi CSI/RSSI 感知平台:硬件门槛(ESP32-S3)、Claude/Codex 插件、隐私与误判风险。
工程实践
Matt Pocock Skills
真实工程导向的可组合 Agent skills:需求对齐、领域语言、TDD、诊断、架构改善、issue 拆解与交接。
CodeGraph · 本地代码知识图谱
为 Claude Code/Cursor/Codex/OpenCode 预建本地代码知识图谱,Explore agent 一次 MCP 调用即返回符号关系与源码片段,工具调用减少 94%、探索提速 77%。
Claude-to-IM Skill · 把 Claude Code 接入 IM
将 Claude Code / Codex 通过后台守护进程桥接到 Telegram、Discord、飞书、QQ、微信,在聊天中直接驱动编码 Agent 并审批工具调用。
02主题地图
| 主题 | 相关报告 | 核心问题 | 优先关注风险 |
|---|---|---|---|
| 自治编码循环 | Ralph | 如何让多个新上下文 Agent 按 PRD 连续完成故事。 | 危险权限、错误累积、质量门禁不足、成本失控。 |
| Agentic 开发入口 | Warp | 终端、Agent、Drive、Oz 如何组合成开发环境。 | 终端权限、云端上下文、许可证、自动化 review 偏差。 |
| 办公自动化与企业数据 | 飞书 CLI | Claude Code 如何读取、生成、发送和存储飞书内容。 | 个人 token、app secret、权限过宽、prompt injection。 |
| 浏览器自动化 | Playwright MCP | 如何让 MCP 客户端通过结构化页面快照操作浏览器并做验证。 | 登录态泄露、文件访问、网络越界、npx @latest 供应链。 |
| Agent 互联网能力 | Agent Reach | 如何给 Agent 安装网页、社媒、视频、RSS、GitHub 读取与搜索工具。 | Cookie 登录态、抓取合规、上游工具供应链、工作区污染。 |
| 长期任务记忆 | Planning with Files | 如何用文件弥补上下文窗口记忆不足。 | 计划文件注入、hook 脚本、敏感信息落盘。 |
| 空间感知与硬件实验 | RuView | WiFi 信号能否在目标环境中稳定感知人和生命体征。 | 隐私合规、误判、API 暴露、硬件和模型泛化。 |
| 工程实践技能 | Matt Pocock Skills | 如何用小而可组合的技能强化需求对齐、TDD、诊断和架构维护。 | 文档过期、流程依赖人类判断、技能安装供应链、hooks 误配置。 |
| 代码理解 / Agent 加速 | codegraph | 如何让 AI agent 用最少工具调用理解大型代码库? | 主会话误调用、索引开销、图谱漂移 |
| AI Agent · IM 桥接 | Claude-to-IM-skill | 如何让 Claude Code/Codex 跨 IM 远程接收指令并安全审批工具调用? | 凭证泄露, 越权工具调用, 平台能力差异 |
03研究边界
已完成
读取官网、GitHub API、README、release notes、安装文档、技能文件与脚本;按 结论 → 能力 → 应用 → 风险 → 来源 五段式统一结构产出。
未执行
未登录 Warp / 飞书 / Claude Code 插件市场;未运行 RuView Docker 或硬件;未实际执行 Planning hooks、Ralph 自动循环、Agent Reach 安装、Playwright MCP 浏览器会话或 Matt Pocock skills。"运行效果"类结论需在目标环境复验。