# AI工具越来越多，普通人到底应该怎么选？

URL: https://caijiao.org/posts/197
Source: docs/posts/197.md
Description: 选 AI 工具不看功能强弱，看两件事：它错了你能不能发现、你多久用一次。Product Hunt 每天约 668 次发布、能上首页的只有约 2.8%，大多数工具从来没被真正验证过。

我去年删掉了收藏夹里大半的 AI 工具，留下来的不到十个。删的时候没有统一标准，纯粹是"想不起来打开"的就删。删完回头看，留下的那几个有个很明显的共同点：**我能在几秒钟内判断它给的结果对不对。**

这个观察后来变成了我选工具的唯一标准。因为"这个工具强不强"这个问题根本没有答案——同一个模型，在不同任务上的表现能差出一个量级，而你真正要防的不是它弱，是**它错了而你不知道**。

Product Hunt 上每天大约有 668 次新产品发布，能登上首页推荐的约 2.8%。这意味着绝大多数你听说的工具，从来没有被足够多的人在真实任务里验证过。看发布会得到一个功能列表，得不到可靠性信息。

## 第一刀：它错了，你能不能发现

按这一刀切，工具分成两类。

第一类，结果对错你一眼能看出来。翻译一段你懂的语言、把一段文字改成另一个语气、给代码改个变量名、把一张图片的背景去掉。这类任务上，模型再弱也不怕，因为它错了你会立刻重来，损失只是几秒钟。选最便宜、最快的，甚至选免费的。

第二类，结果对错你没有能力判断。一份合同里的条款解释、一个你不懂的领域的专业结论、一段你没法逐行读完的生成代码、一个涉及具体法规或金额的计算。这类任务上，工具选错的成本是"你以为对了"。

第二类的处理方式不一样：要么换成能给出可核验来源的工具，要么把任务拆小到你能判断为止。拆小是更可靠的办法——把"帮我看看这份合同有没有坑"拆成"把第三条翻译成大白话"，后者你能判断，前者不能。

## 第二刀：你多久用一次

频率决定你该为它付多少钱、花多少时间学。

每天都用的工具，值得投入时间摸清它的脾气：它擅长什么、在哪些输入上会退化、输出格式怎么控制。这些知识是一次性投入、长期复利的。也值得付费——一个月几十块换每天省下二十分钟，账很好算。

一个月用一两次的工具，反过来：不要花时间学，不要订阅，用免费额度或者按次付费。我见过有人为了一年用三次的需求，专门研究某个工具的提示词写法，研究完那份需求也没了。

这两刀交叉出四个象限，处理方式很清楚：高频且能判断的，选顺手的，深度用；高频但判断不了的，要么补上判断能力，要么换方案，这是最需要投入的一格；低频但能判断的，随手用，不投入；低频又判断不了的，尽量别用 AI，找专业的人。

第四格值得多说一句。很多人吃亏就吃在这里——一年用一次的税务问题、偶尔要看一次的法律条款、只做一回的医疗信息，这些任务上你既没有判断能力，也攒不出经验来校准它。用 AI 拿到一个通顺的答案，比没有答案更危险，因为你不会去核实。这类事情要么找人，要么接受不确定性，别假装解决了。

判断能力是可以补的，而且补起来很快。拿一个你知道正确答案的问题去问它，看它错在哪、错得多离谱，你对它的校准就建立起来了。这个校准会迁移到其他任务上——你会知道它大概在什么量级上可靠，什么时候必须自己动手核一遍。

## 别按"功能强不强"选，按"接不接得进你的流程"

还有一个比功能更实际的维度：它的输出能不能直接进入你下一步。

一个能直接在编辑器里改代码、改完能跑测试的 AI IDE，和一个需要你把代码复制过去、再把结果复制回来的网页对话框，在模型相同的情况下，实际产出能差几倍。差的不是生成质量，是往返成本——每一次复制粘贴都是一次上下文损耗，而上下文损耗会直接反映在结果质量上。

同理，一个能读你整个项目目录的工具，和你手动喂文件的工具，在跨文件任务上不在一个层级。判断方法：看它能不能自己拿到它需要的输入。需要你手工搬运上下文的，上限就被搬运费锁死了。

顺带说一件和选型直接相关的事：怎么快速验证它给的产出。我的习惯是先在一个干净目录里单独跑一遍，而不是直接合进项目——[JavaScript](/javascript/) 项目的依赖隔离足够轻，临时起一个目录验证的成本很低；牵扯外部环境的行为，用 [Docker](/docker/) 起一个一次性容器跑，跑完就删，不污染本机。这两步加起来不到五分钟，却能把大部分"看起来对"挡在外面。能低成本验证的工具，实际可用度会高出一大截。

前端开发者在这件事上还有个天然优势——浏览器和命令行本身就是最好的集成点。一批小工具做成纯客户端页面，不上传、不登录，用完就走，这类形态在 [在线工具](/tool/) 目录里很常见，它们的共同点就是接得进流程：打开、粘贴、出结果、关掉。

## 关于"要不要等更好的"

总有个声音说再等等，下个月会有更强的模型。这话没错，但等的机会成本被低估了。

真正稀缺的不是工具能力，是你对"哪类任务该交给它"的判断。这个判断只能在大量真实使用里长出来，看测评长不出来。早用弱模型、把流程搭好的人，在强模型出来时是直接受益的；一直在等的人，强模型出来时还得从零开始学怎么用。

工具本身在快速趋同，模型能力的差距按季度在缩小。拉开人和人差距的，是那套已经跑顺的流程，和那份知道什么该交给它、什么必须自己来的清单。

---

*Product Hunt 发布量与上首页比例为其公开统计页面数值。*
