深夜打开ChatGPT,输入一段不敢对任何人说的话。你以为对面只是一台机器。错了。成立于2015年的OpenAI,旗下对话式AI产品ChatGPT近日被曝光的“莉莉项目”(Project Lily),正雇佣几百名外包员工,逐字翻阅普通用户的聊天记录,进行人工打分与内容质检。

希鸥网观察到,该项目的评分区间为1到7分,覆盖免费、Plus、Pro全部用户等级。外包招聘方为Crossing Hurdles公司,薪资通过Mercor平台结算,有员工透露时薪超50美元。最关键的是:即使你此刻手动关闭该功能,仅对新对话生效,此前产生的所有历史记录,依然会被纳入人工审核范围。这个归属OpenAI内部、定位于大模型用户数据隐私治理与人工反馈优化赛道的项目,其隐私过滤器被官方承认并不精准。

OpenAI为何要冒天下之大不韪?底层逻辑藏在AI模型的“对齐”焦虑里。ChatGPT的迭代依赖人类反馈强化学习,即RLHF。简单说,模型给出多个回答,需要真人判断哪个更符合“克制、专业、自然”的标准,再反哺训练。外包员工读你的提问,揣摩真实诉求,给AI回复打分——你的私密对话,成了模型进化的免费养料。这是商业模式决定的路径依赖:谁掌握高质量人类反馈数据,谁的模型就更懂人话。

但用户的心理契约被撕碎了。人们把ChatGPT当树洞,输入医疗隐私、财务状况、不敢示人的心事,默认对面只是机器。这种信任建立在“单向透明”上——你暴露自我,平台却从不告知谁在看你。直到内部文件泄露,用户才惊觉,那个深夜陪你聊天的“AI”,背后可能坐着一个时薪50美元的陌生人。信任的建立需要数月,崩塌只需一条爆料。

更隐蔽的裂痕在组织执行层。Crossing Hurdles负责招聘,Mercor负责结算,OpenAI将审核流程外包,链条上的每一环都在稀释责任。官方宣称先用隐私过滤器筛查,过滤后才推给人工。可自己承认过滤器不精准,冷门隐私、模糊表述常漏判。出了事,免责条款早已写好。反观Gemini,隐私声明写得通俗易懂,用户一眼能看到“部分对话会由人工审核”。透明公开本不复杂,只是愿不愿意的问题。

希鸥网认为,这场博弈里没有绝对的赢家。OpenAI获得了低成本、高质量的人类反馈数据,加速模型迭代;外包员工获得了时薪超50美元的收入,远超行业水平。受损的是用户——他们用隐私喂养了AI,却被剥夺了知情权。Anthropic等公司同样采用人工审核优化模型,这是行业常态。但最大的问题从来不是技术,而是信息不透明。当用户发现自己的聊天记录一直在被真人翻看,而官方从未主动公示,修复信任的成本将远超节省下来的合规成本。

精益创业的逻辑告诉我们,初创企业的核心价值在于产出“可验证的客户认知”,而非功能开发本身。OpenAI的莉莉项目,本质上是在用最低成本获取最真实的用户认知——你的提问就是需求样本,外包员工的打分就是验证数据。但这里有一个致命的假设错误:用户是否真实获益?当隐私被侵犯,这种“认知”是建立在沙土上的。能产出可验证客户认知的工作才是价值,其余全部是浪费。OpenAI若不能解决信任假设,再高效的审核流程都是巨大浪费。

创业的本质是科学实验,必须围绕“价值假设”和“增长假设”设计可量化的最小可行产品。OpenAI的MVP不是新功能,而是一套人工审核机制。问题在于,这个MVP直接跳过了“用户是否接受”的验证环节。它假设用户默认同意,假设隐私过滤器足够可靠,假设关闭按钮真的能关闭。三个假设,没有一个经过真实用户行为数据的检验。精益创业要求快速验证关键业务假设,而非高效交付功能。OpenAI高效地交付了审核流程,却忽略了最关键的信任验证。

给创业者的启示很具体:透明化不是事后补丁,而是产品设计的第一行代码。想让用户把你当成可以倾诉的私密伙伴,就必须在隐私声明里用最大字号写清楚谁在听、听了做什么。不要用“可能”“部分”这类模糊表述消耗用户耐心。主动公示人工审核机制,把选择权交还用户,关闭功能必须覆盖历史记录。这些动作不增加技术成本,只增加诚意成本。在AI产品同质化竞争的今天,信任是唯一无法被复制的护城河。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo