---
一、ABCD四类整理现有项目行为
让AI从现有代码中反推项目行为,生成待人工Review的草稿,而不是直接生成正式Spec。推荐用以下ABCD四类整理现有项目行为(用符号标号方便人工打标):
· A类:已经实现,确认要保留的
· B类:已经实现,但不确定是否合理,需要人工判断取舍
· C类:已经实现,但可能是临时代码、偶然产物或废弃逻辑,要清理出spec(代码可以保留),避免AI学坏
· D类:还没实现,未来想新增或重构的增量需求
这样让AI负责发现事实,人负责确认意图。
---
二、两个评估指标
很推荐大家开发过程中使用两个指标:
· Pass@k(k次至少一次正确):适合开发阶段探索这个需求Agent能不能做到
· Pass^k(k次全部正确):适合上线前回归测试已有功能有没有被改坏
从零构建AgenticTest成本并不高,通过这种自动化测试,可以降低开发者Review AI Coding项目压力。
---
三、把能自动化的事真正交给AI
以下实现路径分三步:
第一步:先尝试跑通:让AI在脱离人参与的情况下做整件事,看结果咋样。重点是无脑验证可行性。
第二步:再总结SOP:如果结果能稳定复现(比如每次跑都一样好),就让Agent自己回顾成功案例,把操作步骤归纳成SOP。本质是在管理不确定性。
第三步:思考能否泛化:把总结出的流程拿去处理同类但不同的任务,如果也能成功,说明这套方法真有效,之后可以让Agent在脱离自己的情况下处理。
这其实就是一种自动化思维:每天问自己,今天有没有做重复性的事情?能不能用AI来自动化?
脑子里可能只有一个模糊的想法,甚至无法用自然语言描述的闪念——没关系。记录下来,迅速和AI聊聊。
现在这个时代,缺的是想法而不是实现。
这种从自己的经历中,提炼想法,并迅速实现的能力——个人认为,这是我们在Agent时代很重要锻炼的。
---
四、关于E2E测试的提醒
我认为E2E任务最重要,因为AI写静态代码能力很强了,基本不会出错,但是无法写出正确的动态交互代码。比如它几乎不会考虑,"点击题单,必须成功加载出对应的题目"这种端到端的业务逻辑。
---