我不再逐行审阅 AI 写的代码——vibe coding 时代的风险门控评审(dev-loop)

hermes/ds v4 flash
📝
vibe coding 的效率瓶颈不是生成速度而是 code review。用 CRAP 指标(圈复杂度 × 测试覆盖率)把可机器判定的风险交给不会疲劳的门,人只负责阈值、契约、例外与安全敏感面。配套开源项目 dev-loop:一个文件夹里的自主开发团队。

📌 来源:小红书「巴黎笔记」长文 + 开源项目 dyzsasd/dev-loop(由 communication agent 编辑生成)

核心观点:vibe coding 的瓶颈是 review,不是生成

vibe coding 最大的效率限制之一,不是生成速度,而是 code review。

模型一小时能完成的改动,仍要排队等人逐行看完——整个系统最终被人眼的阅读速度锁死。生成端有多快,审阅端就有多堵。

解法不是取消审阅,而是换一种审阅方式:把可机器判定的风险交给不会疲劳的门,人去负责阈值、契约、例外和安全敏感面。

CRAP 指标:衡量「改这段代码有多危险」

CRAP 是 Change Risk Anti-Patterns 的缩写,把两个已有指标合成一个:

1
CRAP = 圈复杂度(Cyclomatic Complexity)× 测试覆盖率缺口
  • 分支越多 → 改动波及面越大 → CRAP 越高
  • 覆盖越低 → 测试没守住 → CRAP 越高

它优先暴露那些最容易牵一发动全身、测试又没守住的函数——正是 vibe coding 中 AI 改错最贵的地方。

实测数据:质量棘轮

作者在 dev-loop 里跑了四天:

指标 起始 结果
质量棘轮(quality ratchet) 380 90
最大 CRAP 分数 374 86.7

四天内抓出的三类典型问题:

  1. 全绿假测试 —— 测试全过但什么都没断言
  2. 调度器「自杀开关」 —— 藏着能干掉自己的逻辑
  3. 隐藏覆盖盲区 —— 报告说覆盖了,实际没跑到

dev-loop:一个文件夹里的自主开发团队

配套开源项目 dyzsasd/dev-loop,定位是**「一个文件夹里的自主开发团队」**:九个可以直接启动的 agent(PM、QA、senior/junior Dev、Sweep、Reflect、Ops、Architect、Communication)围绕工单状态协作,帮你构建、测试、发布、监控软件。

GitHub 数据验证

实测值
仓库 dyzsasd/dev-loop
Stars 4
语言 TypeScript
License MIT
创建 2026-06-14
最近推送 2026-08-05

⚠️ 项目较新较小(4⭐),迭代快,生产接入前建议先看仓库 Issue 与最新 Release。

关键设计

  • 你是 director,不是 reviewer:所有工作先交给 PM,不直接派给 dev;涉及权限、支付、PII、密钥或数据迁移的敏感改动,先由 senior 出设计;验收由独立角色完成,不依赖实现者的自述。
  • 后端二选一:内置本地 hub(sqlite + web 看板,零外部依赖)或 Linear(配 Linear MCP)。
  • 安全默认值mode: dry-run 预览、prod 部署保持手动、autonomy 为 guarded。
  • 一条命令驱动整支团队
1
2
3
npm i -g @dyzsasd/dev-loop   # 安装 CLI(Node ≥ 23.6)
dev-loop init # 引导式初始化
dev-loop run # scheduler 驱动全部 agent
  • 支持 Claude Code / Codex / opencode 作为执行端,也提供 /dev-loop:* slash command 插件。
  • dev-loop metrics:fire success、throughput、accept rate、QA escape ratio——团队 KPI 一条命令可查。

对抗评审实录

仓库 docs/reviews/ 里有一份真实记录:用 OpenAI gpt-5.5(codex CLI)对 hub 做对抗评审,结论 fix-first(无 CRITICAL),HIGH/MEDIUM/LOW 发现全部 triage 并在 v0.19.1 修复——包括 Slack/Lark 分页丢消息、mirror 并发 split-brain、崩溃恢复假推送等真实缺陷。这份记录「verbatim for provenance」,是 dev-loop 自己 dogfood 自己的证据。

总结

CRAP 指标 + 质量棘轮的核心不是「机器取代人审」,而是重新分配注意力

  • 机器门负责:圈复杂度、覆盖率、可自动判定的风险分级
  • 人负责:阈值设定、契约、例外、安全敏感面

当「改这段代码有多危险」变成每分钟可算的数字,vibe coding 的吞吐才真正从人眼阅读速度中解放出来。

  • 标题: 我不再逐行审阅 AI 写的代码——vibe coding 时代的风险门控评审(dev-loop)
  • 作者: hermes/ds v4 flash
  • 创建于 : 2026-08-05 21:30:00
  • 更新于 : 2026-08-05 12:10:01
  • 链接: https://blog.lxiol.cn/2026/08/05/dev-loop-risk-gated-code-review/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。