人肉LLM广告牌刷屏:AI大模型背后的人工真相与工程实践

人肉LLM广告牌刷屏:AI大模型背后的人工真相与工程实践 旧金山出现了一块广告牌主角叫 ChatTJB它直接在广告牌上写着“人类驱动的 LLM”human-powered LLM并且明确把自己定位成对 ChatGPT 这类大模型的恶搞。这个创意的核心一句话就能说清你发消息过去对面不是 GPU 集群里跑出来的模型而是真正的人在手动回复你只是整个交互方式长得和 ChatGPT 一模一样。所以它不是一个正经 AI 产品而是一个讽刺作品。它讽刺的正是大模型行业里人尽皆知、但在对外宣传中又心照不宣的事实所谓智能产品背后永远站着一大群不被人看见的人。从数据标注到人工反馈从内容审核到客服兜底LLM 的每一条能力边界几乎都有人力参与的痕迹。下面我不打算替 ChatTJB 做广告只是借着这块广告牌把几个和 LLM 相关的问题拆开讲一遍这个“人肉 LLM”到底在讽刺什么为什么它一句话就能让行业里的人会心一笑以及如果你自己也想做类似实验有哪些可落地的做法和必须守住的边界。顺便把最近大家经常搜的那些 LLM 热词比如框架、Agent、RAG、MCP、FP16 和 BF16放到实际场景里解释一遍。适合谁看做 AI 应用开发的、做产品设计的、对技术营销保持怀疑的人都值得花几分钟读完。1. ChatTJB 是什么旧金山广告牌上的“人肉大模型”1.1 一个不需要 GPU 的“大模型”从命名就能看出来ChatTJB 是在玩 ChatGPT 的梗。ChatGPT 这个名字现在已经是 AI 对话产品的代名词任何以 Chat 开头、后面接几个字母的命名都会让人下意识联想到“这是一个 AI 对话助手”。ChatTJB 就是故意蹭这个认知惯性它让你第一眼以为又是一个新模型第二眼才反应过来原来根本没有模型。所谓 human-powered LLM直译就是“人类驱动的大语言模型”。听起来像工程黑话实际上就是一个很朴素的设定用户打字进来系统把消息交给一个真实的人人阅读、思考、打字回复再以对话界面的形式把结果还给用户。整个过程没有推理加速卡没有显存占用没有 tokenizer有的只是人眼、人脑和键盘。这类设定最经典的历史原型是“机械土耳其”Mechanical Turk。18 世纪有一种外观像自动下棋机的装置内部其实藏着一个象棋高手观众以为自己在和机器对弈实际上是隔着柜子在和人对弈。ChatTJB 本质上把这个老把戏搬到了大模型时代只不过它不再试图隐瞒而是主动把“真人驱动”写成了卖点。也有人觉得这是不是某种新型产品形态比如“真人陪聊”或者“人工外包问答”。从广告牌用词来看parody 这个定位非常明确它就是一个恶搞作品。真正好笑的地方不是“人肉”这个点而是它把大模型产品对外宣传时最爱用的那些词——能力强大、响应快速、持续进化——全部用一个“人工”标签给解构了。1.2 为什么要把广告牌放在旧金山广告牌本身不新鲜旧金山的科技广告牌一直是 AI 公司展示产品的地方。随便哪条主干道上都可能看到某家大模型公司投的大幅海报上面印着新模型的宣传语。ChatTJB 把“人类驱动的 LLM”广告牌放在旧金山本质上是把嘲讽贴到了 AI 从业者的家门口。这个位置选得非常准。旧金山周围聚集了大量 AI 公司、研究机构、创业团队和风险资本每天路过那块广告牌的人很可能就是正在训练下一个模型的人。广告牌这种媒介有一个特点它不适合讲复杂逻辑只适合丢一个足够短的梗。一行“human-powered LLM”就能把信息传达到位看到的人会自己补全后面的延伸思考。放到营销语境里看这也是一次典型的事件营销。它不一定有完整的产品官网不一定有 App甚至不一定有可注册的服务但只要广告牌立起来了讨论就会自然发生。从传播效果来看这个项目不需要完成任何转化指标能引起讨论就已经是成功了。1.3 它到底是产品、营销还是行为艺术从我的角度看它更像是三者的混合体。对外表现像产品广告执行方式像营销事件最终效果像行为艺术。如果它真的提供可注册使用的人工回复服务那它就是一个“超低配版 LLM 服务”只是后端不是 GPU 集群而是排班表上的一组人。如果它只是立了块广告牌没有实际服务那它就是一个观念作品用来让观者反思“我平时到底在和谁对话”。无论是哪一种它都把一个尖锐的问题抛给了所有路人你在屏幕上得到的每一次“智能回复”背后到底有没有人这个问题在 ChatGPT 刚火的时候很多人会直接回答“当然有模型”。但当你了解数据标注、RLHF、内容审核、客服兜底这些环节之后会发现答案远没有那么简单。这也是 ChatTJB 能让人会心一笑的原因——它不是在嘲笑 AI而是在提醒所有人AI 产品从来不是完全自动运转的。2. 这个恶搞为什么能成立LLM 行业本来就离不开“人”2.1 训练之前数据标注是绕不开的前置工序大模型训练依赖海量文本但这些文本不是拿来就能用的。网络爬下来的语料里有大量重复、低质、格式混乱、夹带广告和无关代码的内容。这些数据需要经过清洗、去重、过滤、分类很多环节仍然需要人工介入。更典型的是指令微调阶段。要让模型学会“用户问什么就答什么”需要准备大量指令样本这些样本往往要人来编写或筛选。什么算好的回答、什么算跑题、什么语气更合适这些标准很难完全靠程序自动化判断最终还是要人来定义。所以“大模型很厉害”这句话成立的前提是背后有一整套人工数据工程在支撑。如果只看到模型推理时的那几十毫秒就会忽略数据准备阶段按周和月计算的人力投入。ChatTJB 的“人肉”设定恰好就是把这段被隐藏的工作量重新亮了出来。2.2 训练之中RLHF 本质上是人教模型如果你看过大模型相关的技术资料一定见过 RLHF 这个词全称是 Reinforcement Learning from Human Feedback人类反馈强化学习。它的核心流程是让模型对一个指令生成多个回答然后由人给这些回答排序或打分模型再根据人的偏好调整自己的输出。这就是一个非常直白的人工教学环节。模型并不知道什么句子“更像人话”是标注人员一次次告诉它这个回答更好、那个回答太啰嗦、这个跑题了、那个冒犯了。经过大量迭代模型才逐渐学会模仿人类偏好的表达方式。放到 ChatTJB 的语境里会发现很有意思当你在后台让一个人手动回复用户时这个人本质上就是“唯一的、全能的强化学习策略”。他的每一次回复都在展示一种偏好只是这次不需要再训练一个模型去逼近他而是直接把“模型”这个角色砍掉让人自己上。听起来很荒诞但行业内真正的训练流程里就是靠大量这样的人在“喂”模型。2.3 上线之后审核、拒答、评测还是要人兜底模型上线后人力并没有退场。内容风险控制需要人来配置和审核敏感问题需要人来制定拒答策略产品的高频错误需要人来复盘。很多看起来是模型自动完成的判断背后其实是产品团队预先写好的规则和人工兜底机制。评测环节更是明显。要判断一个模型在某个领域是不是变强了通常需要拿一批标准测试题去跑。这批测试题怎么设计、参考答案怎么定、模型输出怎么打分都离不开人。即使使用另一个模型来评测最终也要有人对评测结果做抽样校验。在聊天机器人产品里还有一个常见的现象当模型无法解决用户问题时系统会提示转人工客服。所谓“转人工”就是承认模型能力有边界需要一个真人兜底。ChatTJB 只是把这个兜底逻辑做到了极端所有回复都是人工模型完全不存在。它用最夸张的形式说出一句大实话任何“智能系统”的可靠性最终都以人的参与为上限。3. 用“人肉 LLM”的视角重新理解 LLM 产品指标3.1 延迟人打字要多久模型推理就要多久用过 LLM 对话产品的人通常都会注意到回复不是瞬间出现的而是像打字一样一点点冒出来。这种“流式输出”设计本来是为了改善体验却也制造了一个非常有趣的类比人是一个字一个字敲出来的模型生成 token 也是逐个生成的。如果把 ChatTJB 当成人肉 LLM 来看它的延迟会特别真实人需要读完整段问题思考一小段时间再动手敲键盘。一个熟练的打字员每分钟能打上百字但要让他连续回几十条消息他的响应速度会明显下降。这和大模型 API 在并发升高后延迟变长的现象非常像。我一般在评价一个 LLM 服务时会先看单次请求的延迟再看高并发下的延迟变化。如果只是个人学习用免费网页版就够了如果要集成到业务里就要关注 API 的响应时间、超时设置和失败重试。延迟稳不稳定有时候比单次快不快更能说明服务靠不靠谱。3.2 上下文长度人的记忆窗口就是模型的上下文窗口最近几年各家模型都在比上下文长度从 8K 到 128K甚至到百万 token 级别。上下文窗口越大意味着模型能记住更早的内容但这并不等于它一定能用好这些内容。过长的上下文会让注意力计算成本上升也可能让模型在大量无关信息中抓不住重点。人肉 LLM 在这个问题上有一个天然的答案人的短期记忆非常有限。一个人同时处理几十个对话大概率会忘记前几条消息的内容这就是最真实的上下文窗口。如果 ChatTJB 的设计者愿意甚至可以在界面上加一个“抱歉我忘了你说过什么”的返回结果用来讽刺那些宣称超长上下文但实际表现平平的模型产品。实际使用时要明白不要只盯着上下文长度的数字。更重要的指标是模型能不能在长对话里准确引用前面说过的信息检索增强RAG能不能把最相关的资料找出来。这些能力往往比“窗口有多大”更影响用户体验。3.3 并发和限流一个人只能同时服务这么多请求大模型 API 通常有并发限制和速率限制比如每秒最多请求多少次、每分钟最多消耗多少 token。服务方设置这些限制是为了保护后端资源防止某个调用方把算力耗尽。人肉 LLM 也有同样的限制只不过它的上限不是 GPU 显存而是一个人的体力和注意力。假设一个后台只有一个人在回复那么他同时能接的对话可能只有三到五个再多就会开始精神涣散。如果要提升并发就得加人加了人就要排班、培训、写答案规范。这个逻辑和大模型服务扩容几乎一模一样加机器、加副本、做负载均衡成本都会线性上升。所以在评估一个 LLM 应用时并发能力一定要和成本一起看。有些服务号称支持高并发但价格也成倍增长有些服务便宜但高峰期排队严重。要先明确自己的场景是低频率的个人使用还是高并发的生产调用再决定用 API 还是本地部署。3.4 Token 计费按字数收钱的模式其实很“外包”几乎所有主流 LLM API 都按 token 计费输入和输出各算各的。用户多问几句、长文本多传几轮费用就会明显上升。这种计费方式本质上和按字数计酬的翻译外包、文案外包没有太大区别只是结算单位从“千字”变成了“千 token”。人肉 LLM 如果商业化也完全可以按 token 计费人工回复者每写 1000 字内容就向用户收取相应费用。这听起来很荒诞因为人会偷懒、会缩短答案而模型的输出长度是由参数决定的。但反过来想模型输出多少 token、到底是不是有效信息用户其实很难控制。计费模型越精致就越需要用户带着怀疑去使用。这也是我在做技术选型时的一个原则不要只看单价要看你为无效输出付了多少费。一个模型话痨但答非所问再便宜也是在烧钱一个模型输出简洁但每次都能命中要点贵一点也值得。4. 如果我想自己复刻一个“人肉 LLM”实验4.1 最小实现方案消息队列加人工操作台ChatTJB 这个项目的技术实现大概率不复杂但如果我们不做广告牌只在本地跑一个最小实验还是可以用很轻的工具搭出来。思路很简单前端聊天页面把用户消息写入一个消息队列另外做一个后台操作台让扮演“人工回复者”的人看到队列里的新消息在操作台里输入回复并提交。前端通过轮询或 WebSocket 收到回复后再以打字效果展示出来。消息队列可以用 Redis 的 List 结构或者直接用一张消息表加一个状态字段。操作台可以是一个简单的 Web 页面实时显示当前排队数量、正在回复的消息、历史记录。前端只需要一个输入框、一个发送按钮和一个消息列表。如果想模拟得更像 LLM可以在回复里带上 token 数、耗时、模型名称这些元信息。比如“本次回复消耗 128 tokens耗时 2.3 秒”这些都属于前端展示层的内容跟人脑没有任何关系。第一次实验不用追求完整先把“用户发送、后台收到、人工回复、前端展示”这条链路跑通再考虑加功能。4.2 用真人能模拟哪些“高级能力”用真人替代模型之后你会发现很多所谓的高级能力突然变得非常灵活流式输出可以设置前端按照打字速度逐字显示也可以直接整段显示。上下文理解人可以自己翻聊天记录还能记住上一个问题。多模态能力用户发一张图片过来人可以看图说话。工具调用人可以打开搜索页面查资料再重新组织答案。风格控制可以在操作台上写一个“本日人设”让回复者按指定语气交流。这些能力在真实 LLM 里每一件都需要专门的模型能力和工程支持。但在人肉 LLM 里只需要靠人的通用能力就能全部覆盖。这个对比本身就说明了一件事模型的“智能”是特定任务上的拟合而人的智能是跨任务的通用能力。当然人肉 LLM 的优势和劣势同样明显。速度慢、无法同时处理大量请求、状态不稳定、人力成本高这些都是模型相对更有优势的地方。更真实的是一个人在困的时候回答质量会明显下降这和模型在数据分布外表现下降有相似之处。4.3 边界提醒恶搞归恶搞不能伪装成真实 AI 服务我建议任何想玩这个梗的人都先把边界划清楚。做实验、参加黑客松、在自己的博客里演示都没问题。但如果你把“人肉 LLM”包装成一个真实产品让用户误以为对面真的是 AI 模型甚至因此付费那就不是恶搞而是虚假宣传甚至可能涉及欺诈。同一类实验的合规红线主要有几条必须明确告知用户“这是人工回复”或“这是模拟实验”。不得假借知名 AI 产品的名称和外观让人产生混淆。不得收集并滥用用户隐私信息。人工回复内容同样要遵守内容安全规则不能因为“是人写出来的”就绕过平台审核底线。