很多 AI demo 都会给人一种“已经快做完了”的错觉。页面上有输入框,有流式输出,有时候答案还挺惊艳,于是看起来只差上线。但只要离开演示环境,真实问题就会立刻冒出来:用户到底想完成什么任务、什么时候答案算可用、失败后怎么处理、成本能不能撑住、结果能不能被信任。
所以我越来越觉得,AI 应用最难的部分不是“把模型接进来”,而是“把能力接进任务里”。前者解决的是可用性,后者解决的才是产品价值。
先定义任务,不要先沉迷能力
很多团队一开始就会讨论模型、参数、上下文窗口和工具调用,但真正应该先说清楚的是另一组问题:
- 用户到底在替什么工作买单。
- 哪一步最耗时、最容易卡住、最值得被 AI 接手。
- 什么结果算“有帮助”,什么结果只是“看起来聪明”。
- 哪些情况必须中断、澄清或转人工。
如果这些边界没有定义清楚,模型表现再强,也只是在帮你放大不明确的需求。
好体验来自可预期,而不是偶尔惊艳
AI 产品最容易被夸奖的地方,是某次回答特别聪明;最容易被放弃的地方,则是它下一次突然不靠谱。用户真正需要的往往不是“偶尔超神”,而是“整体可预期”。
这也是为什么我会把这些东西看得很重:
- 当前系统在做什么,用户能不能看懂。
- 模型不确定时,有没有明确的反馈。
- 输出是否可以继续编辑、重试、改写或回到上一步。
- 延迟、额度和失败是不是被产品层妥善处理了。
这些事情听起来不像“AI 技术”,但它们决定了 AI 到底像一个可用产品,还是像一个偶尔有亮点的玩具。
成本和评估也是产品的一部分
当应用进入真实使用场景之后,token 成本、重试策略、输出评估和人工兜底都会变得非常具体。你会开始关心:
- 哪一类请求值得走更贵的模型。
- 哪些步骤可以缓存、裁剪或提前结束。
- 结果要如何抽样检查,才能知道质量有没有变差。
- 新 prompt 或新 workflow 上线后,用户完成任务的效率有没有真的变好。
所以我现在越来越把 AI 应用理解成一套完整的产品系统。模型当然重要,但它只是能力源头;真正决定体验的,是你如何定义任务、组织反馈、约束成本,并且持续评估结果。