Will you take responsibility for your AI?
Chinese original · The full essay is presented in its original language.
以前写不出一篇好文章,可能是表达能力不够。现在 AI 可以很快写出十篇看起来完整的文章,但你必须判断哪一篇有主线,哪一句是空话,哪一段只是顺滑地绕开了问题。
以前做不出一份调研,可能是资料不够、时间不够、整理能力不够。现在 AI 可以迅速列出背景、趋势、公司、案例和结论,但你必须判断哪些是事实,哪些是推测,哪些只是把互联网上的共识重新排列了一遍。
以前做不出产品方案,问题可能卡在执行上。现在 AI 可以帮你铺出用户画像、功能模块、商业模式和风险分析,但你必须判断:这个方案到底解决了真实问题,还是只把几个看起来正确的词放在了一起。AI 让产出变得容易,也让验收变得困难。
AI 最容易制造出“已经完成”的感觉
很多人以为自己用不好 AI,是因为提示词写得不够好。这个判断有一部分道理,但它只说到了表层。真正的问题可能不是“怎么让 AI 回答得更好”,而是“你自己到底知不知道什么叫好”。
如果你不知道什么叫一篇好文章,AI 写得再快,你也只能让它“再自然一点”“再有深度一点”。如果你不知道什么叫一份好调研,AI 给你十页材料,你也只能从里面挑一些看起来顺眼的句子。如果你不知道什么叫一个好产品方案,AI 越能生成完整框架,你越容易被那种完整感骗过去。
因为 AI 很擅长制造一种东西:看起来已经完成。它会给你标题、结构、步骤、总结、建议、风险和下一步。它很少像一个没准备好的人那样明显卡住,输出通常是流畅的、完整的、有条理的。正因为如此,它也最容易让人放松警惕。
但完整不等于成立,流畅不等于有判断,有结构也不等于解决了问题。过去,问题往往以粗糙和未完成的样子暴露出来。现在,我们更容易被精致骗过,因为 AI 可以把一个并不成立的东西,包装得很像已经成立。所以,AI 时代真正稀缺的,可能不是效率,而是验收标准。
验收标准,是一个人对“什么值得留下”的判断
验收标准不是“字数 1500 字”“列出五点建议”“语气自然一点”。这些要求当然有用,但只是最外面的一层。真正的验收标准,是你能不能判断一个东西为什么成立、哪里不成立,以及它是否值得进入现实。
“验收”也比“判断”更重。判断可以停留在评价,验收却意味着放行。一个东西一旦被你接受,就可能带着你的名字进入一篇文章、一项决策、一个产品,最终进入现实。你不仅要判断它好不好,还要愿意为它带来的结果负责。
所以,无论面对一篇文章、一份调研还是一个产品方案,真正需要回答的都是:它有没有提出真实的问题?有没有区分事实、推测和观点?有没有帮助人作出下一步判断?又有哪些部分只是为了显得完整,删掉也不影响结果?
这些问题背后,是一个人的经验、审美、价值观、风险意识和责任感。AI 可以参与判断,却不能替你承担判断的后果。不过,验收标准也不是少数人的天赋。它并不是凭空长出来的,而是可以从真实场景、样本对比和失败复盘中一点点训练出来。
第一步:先问这个东西要进入什么场景
建立验收标准时,最容易犯的错误是一开始就写“有深度”“有洞察”“全面”“专业”“可落地”。这些词听起来都对,却几乎无法验收。
更有效的起点是先问:这个东西最后给谁用,要帮助他完成什么行动?
一篇文章不是为了“写得好”,而是为了让读者读完以后,对某个问题有更清楚的理解。一份调研不是为了“资料全面”,而是为了让一个决策变得更可靠。一个产品方案不是为了“结构完整”,而是为了让团队知道先做什么、不做什么,以及为什么这样做。
使用场景一旦明确,标准才会变得具体。你不再追问“它够不够高级”,而会追问“它有没有帮助真实的人完成真实的判断”。
第二步:同时积累好样本和坏样本
验收标准很少来自空想,更多来自比较。你看过足够多好文章,才会知道什么叫有主线;经历过足够多项目返工,才会知道哪些问题一开始不说清楚,后面一定会付出代价;见过足够多漂亮但空洞的方案,才会对“看起来很完整”产生警觉。
可以给自己准备两个长期样本库:一个保存你认可的作品,一个保存你不接受的作品。但样本只有经过解释,才会变成标准。每次保存时,都要补上一句:它为什么好,或者为什么不好。
好在哪里?是问题抓得准,结构有递进,例子贴近生活,还是结论真的推进了思考?不好在哪里?是概念太空,没有事实支撑,没有使用场景,还是把一个问题讲圆了,却没有带来任何新的东西?
时间长了,原本模糊的感觉就会变成可以表达的判断。你不再只是说“这篇不太对”,而是能指出它哪里不成立、为什么不成立、应该往哪里改。
第三步:先写清楚自己不接受什么
相比直接定义“什么是好”,人通常更容易识别“什么不能接受”。所以建立验收标准,可以先从一份拒绝清单开始。
比如写作时,我不接受没有真实观察的开头,不接受只有概念没有人的生活,不接受一句一段的伪深刻,也不接受看起来很高级,却不知道在解决什么问题的表达。
做调研时,我不接受没有来源区分的结论,不接受只列趋势不讲变量,不接受只总结别人说了什么,也不接受没有风险和反例的乐观判断。
做产品方案时,我不接受一上来堆功能,不接受没有核心用户场景,不接受没有 MVP 边界,也不接受把“用户可能需要”当成“用户真的会用”。
这份清单并不是为了变得挑剔,而是为了让自己的判断有边界。很多标准不是从正确答案里长出来的,而是从一次次踩坑、返工和后悔里长出来的。
第四步:把形容词改成检查问题
一条标准只有能够被检查,才真正有用。
比如,不要只说“文章要有洞察”,而要问:它有没有打破一个常见误解?读者看完以后,能不能复述出一个新的判断?不要只说“调研要全面”,而要问:它有没有区分事实、推测和个人判断?有没有指出仍然缺少哪些证据?不要只说“方案要落地”,而要问:如果明天开始执行,第一步是什么?由谁完成?用什么结果判断它有效?
当标准变成问题,它就可以被反复使用。AI 给出结果以后,你不再只能说“再优化一下”,而可以明确指出:这里缺少事实区分,这里没有用户场景,这里没有失败风险,这一段只是重复结论,没有推进主线。
第五步:用真实结果校准标准
标准写得再漂亮,如果不能帮助现实变好,也只是另一种形式主义。
文章发出去以后,读者有没有真正理解?哪些地方引发了讨论,哪些地方只是你自己觉得精彩?方案进入团队以后,是否让大家更清楚取舍,真的指导了行动,而不只是完成了一次汇报?AI 输出被使用以后,是否减少了返工,是否让下一次协作更快进入状态?
这些反馈会反过来修正标准。你会发现,有些要求只是个人偏好,对真实场景没有帮助;有些原本没被重视的细节,反而决定了结果能不能成立。
所以,验收标准不是一次写完的清单,而是一个人的判断系统在现实中不断更新。
效率之后,是人的责任
AI 会逐渐把越来越多的人从执行推向验收。过去很多事情必须亲自做,现在事情越来越容易被做出来,但仍然必须有人判断:它是否成立,是否可靠,是否值得,以及应该由谁承担后果。
这个变化并不轻松。执行能力不够时,人还可以说时间不够、工具不好、资源不足。可当 AI 把执行成本降下来以后,一个人会更直接地面对自己的判断空洞。你会发现,原来自己不是不会写,而是不知道真正想说什么;不是不会做方案,而是不知道什么问题值得解决;不是不会总结,而是不知道哪些经验真的改变了自己。AI 把很多人的“不会做”,变成了“不会判断”。
当一个人有了自己的验收标准,AI 才会从生成工具变成他的外部能力。否则,AI 越强,他只是越快得到一堆看起来完整、但自己也不知道该不该留下的东西。
以后每次让 AI 生成一篇文章、一份调研或一个方案,我们真正要做的,并不是在它完成后点一下确认,而是在发送、发布、确认之前问自己:如果这份结果带着我的名字进入现实,我愿不愿意为它负责?