Research Hub / AI Agent & DevTools

AI Agent · DevTools Research

把 AI Agent 工具的
能力、应用与风险讲清楚

本中心整理 8 个调研对象:飞书 CLI、WiFi 感知、终端 Agent、长任务记忆、自治编码循环、互联网读取、浏览器自动化、工程化技能。每份报告按统一结构产出 —— 结论 → 核心能力 → 应用场景 → 风险与缓解 → 可追溯来源

AI Agent DevTools 安全风险 工程化

风险优先

Token、Cookie、Prompt Injection、供应链一项不漏。

来源可追溯

每条结论都标注 GitHub / 官网 / Release 出处。

可复验

给出复现命令、配置示例与可执行链路。

横向对比

官方版本 vs 社区版本、能力矩阵、风险等级一目了然。

10调研对象(工具 / 框架 / 实践)
4大风险类别(Token / Cookie / Injection / 供应链)
50+引用来源(官网 · GitHub · Release)
5段式统一结构(结论 → 能力 → 应用 → 风险 → 来源)

01调研报告入口

8 reports · uniform grid

大卡片为高优先级与高风险议题,小卡片为辅助专题。右下角图标表示主题类型。

Ralph · 自治 AI agent loop preview 自治循环

Ralph · 自治 AI agent loop

PRD → JSON 任务、fresh context 隔离、git/progress 记忆、危险权限参数与质量门禁;最具影响力,也最需要风险护栏。

Agent loopHigh risk
阅读报告
Warp preview 终端 Agent

Warp

Agentic Development Environment:终端、Warp Drive、Oz、开源贡献流程、许可证与云端上下文风险。

TerminalOz
阅读报告
飞书 CLI 与 Claude Code preview 办公自动化

飞书 CLI 与 Claude Code

官方 larksuite/cli 与社区 riba2534/feishu-cli 对比:文档、Sheets/Base、消息卡片与 Token 风险。

FeishuToken risk
阅读报告
Playwright MCP preview 浏览器自动化

Playwright MCP

结构化页面快照、网页交互、调试工具与安全边界。

MCP
阅读报告
Agent Reach preview 互联网工具

Agent Reach

网页、社媒、视频、RSS、GitHub 读取与搜索工具;Cookie 与抓取合规风险。

Cookie risk
阅读报告
Planning with Files preview 长任务记忆

Planning with Files

持久化 Markdown 计划:task_plan / findings / progress / hooks。

Hooks
阅读报告
RuView preview WiFi 感知

RuView

WiFi CSI/RSSI 感知平台:硬件门槛(ESP32-S3)、Claude/Codex 插件、隐私与误判风险。

ESP32-S3Beta
阅读报告
Matt Pocock Skills preview 工程实践

Matt Pocock Skills

真实工程导向的可组合 Agent skills:需求对齐、领域语言、TDD、诊断、架构改善、issue 拆解与交接。

SkillsEngineering
阅读报告
CodeGraph · 本地代码知识图谱 preview 代码理解

CodeGraph · 本地代码知识图谱

为 Claude Code/Cursor/Codex/OpenCode 预建本地代码知识图谱,Explore agent 一次 MCP 调用即返回符号关系与源码片段,工具调用减少 94%、探索提速 77%。

Local-firstMCPMulti-Agent
阅读报告
Claude-to-IM Skill · 把 Claude Code 接入 IM preview AI Agent

Claude-to-IM Skill · 把 Claude Code 接入 IM

将 Claude Code / Codex 通过后台守护进程桥接到 Telegram、Discord、飞书、QQ、微信,在聊天中直接驱动编码 Agent 并审批工具调用。

Multi-IMSkillMIT
阅读报告

02主题地图

topic × risk matrix
主题 相关报告 核心问题 优先关注风险
自治编码循环 Ralph 如何让多个新上下文 Agent 按 PRD 连续完成故事。 危险权限、错误累积、质量门禁不足、成本失控。
Agentic 开发入口 Warp 终端、Agent、Drive、Oz 如何组合成开发环境。 终端权限、云端上下文、许可证、自动化 review 偏差。
办公自动化与企业数据 飞书 CLI Claude Code 如何读取、生成、发送和存储飞书内容。 个人 token、app secret、权限过宽、prompt injection。
浏览器自动化 Playwright MCP 如何让 MCP 客户端通过结构化页面快照操作浏览器并做验证。 登录态泄露、文件访问、网络越界、npx @latest 供应链。
Agent 互联网能力 Agent Reach 如何给 Agent 安装网页、社媒、视频、RSS、GitHub 读取与搜索工具。 Cookie 登录态、抓取合规、上游工具供应链、工作区污染。
长期任务记忆 Planning with Files 如何用文件弥补上下文窗口记忆不足。 计划文件注入、hook 脚本、敏感信息落盘。
空间感知与硬件实验 RuView WiFi 信号能否在目标环境中稳定感知人和生命体征。 隐私合规、误判、API 暴露、硬件和模型泛化。
工程实践技能 Matt Pocock Skills 如何用小而可组合的技能强化需求对齐、TDD、诊断和架构维护。 文档过期、流程依赖人类判断、技能安装供应链、hooks 误配置。
代码理解 / Agent 加速 codegraph 如何让 AI agent 用最少工具调用理解大型代码库? 主会话误调用、索引开销、图谱漂移
AI Agent · IM 桥接 Claude-to-IM-skill 如何让 Claude Code/Codex 跨 IM 远程接收指令并安全审批工具调用? 凭证泄露, 越权工具调用, 平台能力差异

03研究边界

scope & limits

已完成

读取官网、GitHub API、README、release notes、安装文档、技能文件与脚本;按 结论 → 能力 → 应用 → 风险 → 来源 五段式统一结构产出。

未执行

未登录 Warp / 飞书 / Claude Code 插件市场;未运行 RuView Docker 或硬件;未实际执行 Planning hooks、Ralph 自动循环、Agent Reach 安装、Playwright MCP 浏览器会话或 Matt Pocock skills。"运行效果"类结论需在目标环境复验。