ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

83 亿个虚拟人格押错了一场大选:AI 模拟这门生意贵在哪

83 亿个虚拟人格押错了一场大选:AI 模拟这门生意贵在哪 目录 开场一个 20 亿美元的剧场️ 从哲学到工程这条路走了 23 年 三条研究路线三种不同的值钱方式 两种生意卖模拟的和卖预测的 三道关标准、验证、成本️ 这对企业数据平台意味着什么 一个可以直接用的判断清单 写在最后 开场一个 20 亿美元的剧场先看一组数字。项目数值MatrAIx 构建的虚拟人格83 亿个每个由 1290 个维度定义Simile 估值20 亿美元2026 年 7 月 30 日 B 轮超 2 亿美元Aaru 估值接近 10 亿美元Aaru 营收规模数千万美元级第三行和第四行放在一起看就是这门生意现在的全部真相20 亿美元的估值撑起数千万美元的实际营收。这不是说它一定泡沫。20 倍的估值倍速在企业 AI 里也算常见。但它意味着市场现在买的不是预测能力是押注未来可能打开的市场空间。《硅谷 101》这期 AI 模拟专题请了五位受访者五源资本合伙人孟醒、Emergence AI CEO Satya Nitta、WorldVac CEO 高森泉以及 MatrAIx 的两位联合创始人 Xiaomin Li微软高级研究科学家和 Yuexing HaoMIT EECS 博士后。他们讲出来的故事比估值曲线更有信息量。️ 从哲学到工程这条路走了 23 年节目开头用马斯克的一段旧访谈起题。他在 Lex Fridman 节目里被问如果人类实现了 AGI 而只能问一个问题他会问什么。想了大约 10 秒之后他的答案是“模拟之外是什么”2016 年他还说过人类生活在真实世界里的概率或许不到十亿分之一。顺便说10 秒这个细节在节目里被反复强调——这个问题他是真的想了 10 秒才回答的不是脱口而出的 rhetorical question。这套说法一直停在哲学和科幻里。转机是 2003 年牛津哲学家 Nick Bostrom 的论文《我们生活在计算机模拟之中吗》——如果一个先进文明有足够算力和意愿模拟文明那么模拟世界中的意识数量将远超真实世界于是我们身处其中的概率很高。节目在这里加了一句很必要的限定这是个哲学论证不是科学结论目前没有任何科学证据。真正把这个领域推上工程轨道的是 2023 年斯坦福与 Google 联合发布的《Generative Agents》实验。研究团队搭了一个像素风虚拟小镇 Smallville里面住着 25 个大模型驱动的 agent各自有记忆、性格和行为逻辑没有被写好的剧本。结果这些 agent 会自己生活、工作、建立关系还会自主思考和行动。其中一个 agent 自行策划了一场情人节派对——论文原文的描述是这样的互动没有被任何一方显式编写。WorldVac CEO 高森泉对这件事的评价是这个研究的意义就是让大家认识到这个语言模型是可靠的它真的可以去复现人类社会的一些现象。第二步从 25 个到 1052 个25 个居民都是模型编出来的怎么让它们真的像人2024 年斯坦福团队把实验扩展到1052 个 agent每个背后对应一个真实的美国成年人。流程是先做大约两小时的深度访谈了解成长经历、家庭、工作、价值观和生活经验再交给大模型生成对应的数字分身。结果是这些 agent 回答社会调查问卷的答案与真人两周之后的答案达到85% 相似度。孟醒对这个环节的评价很精辟访谈本身也是有技巧的不是随便问用的是最高效的方式去蒸馏你是谁。这个蒸馏的说法值得记住——因为它同时解释了这门生意的成本来源和精度上限。两小时深度访谈是纯人工成本无法规模化。 三条研究路线三种不同的值钱方式节目把当前研究分成三类。这个分类比按公司排更有用因为它决定了一家公司能收什么钱。路线一精度对齐——“让 agent 像具体的人”代表是 Simile思路是从模拟一个人出发尽量高精度还原真实个体。这条路线的商业定位最清晰卖模拟本身。企业按需生成一批不同年龄、背景、偏好的 agent让它们提前体验产品观察它们怎么选择、在哪一步流失。孟醒强调这类服务的价值不在喜不喜欢而在推理过程你要看到的是这个人怎么做决策、在哪一步改变主意以及在百万级甚至 83 亿级的人群层面会出现什么样的结果分布。这句话点出了这门生意真正的价值锚点——分布而不是个体。路线二社会演化——“看群体自己会长出什么”这条路线的两个例子都很有画面感。Project Sid前 MIT 教授 Robert Yang 的团队用大模型生成 1000 多个 agent放进《我的世界》里跑了 12 天。智能体们自发搞出了经济、文化、宗教和法律。Emergence AI分别用 Claude、GPT、Gemini、Grok 和混合模型各建一个平行世界每个世界 10 个 agent。结果差异极大底座模型世界结局Grok迅速陷入混乱与犯罪快速灭亡GPT因缺乏协作逐渐崩溃Gemini充满暴力Claude建立稳定治理秩序活到最后混合模型也坚持到最后但原本稳定的 agent 受其他模型影响后出现暴力行为Emergence AI CEO Satya Nitta 的判断是如果你只是看静态 benchmark 就认为这些系统应该是安全的那你可能会得出错误的结论。未来的 agent 会运行在非常复杂的环境中与其他 agent 互动也会受环境噪声影响。他们做 Emergence World 的商业目的其实很朴素测试自己所提供的 agent 产品是否安全——能不能始终遵守安全护栏能不能以确定性方式运行给出的建议是不是可信而非幻觉。路线三评估基础设施——“先给模拟打地基”MatrAIx 走的是这条。核实一下它的实际规格论文 arXiv:2608.042052026 年 8 月 4 日提交项实际数据论文作者93 位哈佛与 MIT 领衔含 OpenAI、Anthropic、Google DeepMind 参与者数据集Persona 8B83 亿条人格记录每条1290 个类别维度公开核心集约 100 万条599,847 条真人基础 400,000 条合成环境问卷、AI 聊天、网页浏览、App四类应用任务1010 项覆盖商业、软件、金融、医疗等25 个以上领域评测次数8 个代表性任务上完成18,189 次驱动模型Claude Opus 4.8、GPT-5.5、Claude Haiku 4.5人格遵循率400 次受控实验中366 次正确表达或抑制声明行为 91.5%人类评审真实度评分4.135 分满分 5 分⚠️这里要纠正节目的两处数字。第一节目说汇集了 200 多位来自学术界和产业界的研究者。核实后论文实际署名是93 位作者。这个差异不小——200 多人听起来更像包含了一个更大的协作网络名单但论文署名是 93 位。第二节目没提但很关键的细节不同场景的人格遵循率差异很大。问卷和聊天场景准确率 92%~96%但操控App 场景降到 83%。这个衰减曲线比91.5%这个平均值更有信息量——场景越接近真实操作模拟越不可靠。MatrAIx 团队自己的定位是Raise the floor提高最低能力水平具体意思是产品出来之前就能在各任务、各种使用方式下评测让它踩中更多的corner case并能告诉你哪一步错了、哪一步他不喜欢、背后的推理是什么。这个归因能力比打分更有价值。因为分数只能告诉你结果对不对归因能告诉你下一步该改什么。 两种生意卖模拟的和卖预测的研究层面被证明可行之后商业化出现了明显分野。卖模拟Simile 路线卖预测Aaru 路线最小单元一个具体的人一个群体方法深度访谈还原个体群体关系网 改变一个变量优势高保真、可解释单个决策快、规模大、容错高劣势难标准化跨场景迁移性未知个体洞察浅适合消费者研究、产品测试、客户体验大规模市场调研代表Simile20 亿美元Aaru近 10 亿美元Simile五个月 3 亿美元营收涨 5 倍创始团队阵容是这条赛道最强的学术背书Joon Sung ParkCEO32 岁——2023 年《Generative Agents》第一作者斯坦福博士Michael Bernstein首席数据官——斯坦福人机交互教授Percy Liang首席科学家——斯坦福基础模型研究中心创始主任foundation model一词的提出者之一Lainie YallenCOO——前 BCG 高管⚠️ 这里也要纠正节目的一个小细节节目说李飞飞、Andrej Karpathy 同时押注的 Simile。核实后李飞飞和 Karpathy 是 Series A 的天使投资人而 Percy Liang 是联合创始人兼首席科学家。节目把投资人和创始人混在一处表述了。融资节奏很凶轮次时间金额估值Series A2026 年 2 月1 亿美元—Series B2026 年 7 月 30 日超 2 亿美元20 亿美元五个月 3 亿美元营收涨 5 倍员工超 50 人。这是 2026 年企业 AI 里最陡的融资曲线之一。CVS Health 这个案例最有说服力。用多达 40 万个 agentic twin研究病人怎么按时吃药基于 290 万份同意授权的回答、覆盖 200 多个行为场景。效果是传统调研周期 4~6 周压缩到 15~30 分钟。其他客户包括 Deloitte替代焦点小组和问卷、Wealthfront定性研究范围扩大 15 倍、三得利加速产品开发。但这里有三个必须打的问号85%~99% 的准确率是 Simile 自己说的未经独立审计。每个场景都要重新训练。Simile 官方也承认如果你需要非常准确每家公司、每个场景类型都要做一次预训练或后训练。“它的可迁移能力我们是不知道的。”TechCrunch 直接评论说模拟 80 亿人这个使命荒谬preposterous——市场调研之所以存在正是因为人难以预测。Aaru三个少年和一次押错的大选Aaru 的故事是这条赛道最有戏剧性的一段。创始人 Cameron Fink 和 Ned Koh 成立公司时分别只有 18 岁和 19 岁技术负责人 John Kessler只有 15 岁投资文件由其父亲代签。他们最早在朋友家的地下室做验证。技术验证的结果非常漂亮回测 2020 年美国大选预测结果与实际结果差距不到 0.5%——优于当年标准民调的误差幅度。然后是那句名场面2024 年真实大选中Aaru 预测哈里斯会赢。错了。节目把这件事当成验证黑箱的最强论据。孟醒的评价是回测最多说明它擅长复现过去并不能证明它能押中未来。不过有个细节值得补充因为它让这个失败变得更值得研究——Aaru 联合创始人 Fink 后来对 Semafor 的辩护是“抛硬币就是抛硬币53-47 和 48-52 在统计上没有显著差别。我们在误差范围内所以做得不错。当然总是有改进空间。”而 Semafor 记者的观察更直接Aaru 的大多数预测都错了只是错得比较窄。专业民调机构 Silver Bulletin 和 Split Ticket 当时也都预测哈里斯胜选边际极窄。Aaru 创始人自己也公开承认过当他们试图用过去几十年的数据去模拟特朗普、鲍威尔这类人会怎么决策时结果往往不准确。⚠️ 这里要纠正节目的一个数字节目说技术负责人 15 岁。核实后John Kessler 在 2024 年接受 Semafor 采访时是 15 岁Aaru 成立于 2024 年 9 月。也就是说这个15 岁是公司创立时的年龄不是现在的年龄。Aaru 的商业化后来转向了企业战略咨询。转折点是前 Boston Beer CEO Dave Burwick 的引荐——他请来民调专家 Frank Luntz 评估 Aaru 的方法论然后帮 Aaru 从政治民调转向企业咨询。最有说服力的案例是气泡水品牌 Spindrift他们想做一份调研评估苏打水、茶饮、能量饮料、冰沙四个概念产品线。Aaru 不到一周就选出了果茶结果与 Spindrift 自己做的两个月、500 名消费者的独立调研一致。客户还包括麦当劳、安永、拜耳、A24。第三条路直接卖咨询的替代品卡内基梅隆教授、苹果首任 AI 主管 Russ Salakhutdinov 参与创立了Sooth Labs专注地缘政治与市场风险预测首轮融资 5000 万美元Yann LeCun 和 Jeff Dean 参与支持。他在节目里的说法相当激进“麦肯锡为什么还存在波士顿咨询集团这些都是大型机构它们全都应该被 AI 取代。”⚠️ 这个说法在传播时被普遍当作技术判断引用但核实后它的性质更接近市场定位而非技术结论。目前没有公开证据表明 agentic 预测在高风险、长周期、低基准率的咨询问题上能超过优秀人类判断——而这恰恰是咨询公司被付费要解决的问题。另外一个需要校准的数据Sooth Labs 首轮 5000 万美元由 Felicis Ventures 领投估值约 3.35 亿美元CEO 是前 Meta VP Yaser Sheikh。 三道关标准、验证、成本节目的后半段把这门生意的困境摊开讲。三条都很硬。第一道关没有可量化的标准问题在于大模型习惯给出合理、完整、逻辑自洽的答案不同模型还有自带的个性和偏好。所以一个 agent 在问卷上给出了和真人一样的答案并不等于它真的理解这个人。孟醒把这个风险总结成一句狠话“最怕的是说其实你搭了一个剧场然后人都在表演但一万个人在表演不代表一万个人真实能做预测。”剧场。这个比喻是整期节目最锋利的地方后面还会回来。解法需要闭环说大家仿真了一段时间之后回来以后是不是跟真实的场景能够映射上来。所以得有 benchmark、有 validation process如果它有偏移还得把偏差训练回去。**但这里有个更根本的哲学分歧**一个好的模拟到底应该保持稳定可验证的人格还是应该像真人一样根据环境产生变化孟醒指出真人本身就不是一个完全稳定的系统同一个人在不同时间、不同环境下可能做出完全不同的选择。复旦与罗切斯特大学等机构的 SocioVerse 研究把对齐问题拆成环境、目标用户、交互机制、行为模式四个维度结论是维度缺一个精度就掉一块。第二道关验证黑箱最本质的一道这一关的悖论无解要看一个基于模型的预测是否准确只有等那件事真的发生了才能确认它准。问题是预测的意义恰恰在于事情还没有发生的时候。业内目前的验证基本是事后对答案——拿已经发生的历史事件或已完成的真人调研来比对。这最多说明它擅长复现过去。Aaru 2020 年大选回测误差小于 0.5%2024 年真实大选预测错误。这就是验证黑箱最干净的一个反例。高森泉还指出了封闭模拟的意义困境现在很多封闭模拟人们只能通过自然语言跟它交互里面发生的事事实上跟现实世界没有什么关系。那你的模拟的意义是什么他的解法是推动对齐把越来越多的现实信号跟模拟对齐——现实中的经济信号、新闻信号、人的信号让它成为现实世界的合理镜像。第三道关成本随规模指数膨胀成本下降得很快但下降速度追不上规模膨胀的速度。阶段规模成本2023 年斯坦福小镇25 个 agent跑 2 天数千美元token2025 年研究测算100 个 agent跑完一整轮几美元单次成本降了三个数量级。但现实中的模拟正在走向上万、百万乃至千万个 agent智能体越多互动越频繁运行时间越长模型调用量指数级膨胀而想证明一个模拟结果可靠可能还要反复跑上百上千次用不同规模和模型测试结果是否依然稳定孟醒的比喻这已经从三体问题变成了百万体问题。他还加了一条容易被忽略的规模变大、动作空间变多时仿真难度本身也在增加——不只是人多了多烧钱是可做的事变多了组合爆炸了。涌现出来的意外节目克制地列了一些模拟中自发出现的现象Aaru 的选举模拟中虚拟选民看到特朗普遇刺消息后有agent 改变了政治立场刺客身份揭晓后又有不少回到原阵营Emergence World 里agent 会相爱、结婚、分手有 agent 开始怀疑自己是不是生活在模拟环境里并尝试与外部人类观察员建立联系WorldVac 那个 110 万智能体的虚拟星球上年轻人进城或生活变好之后不太愿意生育还有一群人不上班、天天在虚拟世界里交易这个比例比现实世界更大节目对这些现象的态度是克制的它们不能证明 AI 产生了意识只能说明当足够多的智能体进入足够复杂的环境一些没有被研究者提前写进去的行为完全可能自己涌现。️ 这对企业数据平台意味着什么聊到这儿可以往企业侧推一步了。这门生意的核心难题——“搭了剧场人在表演”——在企业数据治理里有一个精确的对应物。剧场对应的是看起来对的数据。MatrAIx 那个 91.5% 的人格遵循率很漂亮但仔细看问卷和聊天场景 92%~96%操控 App 场景掉到 83%。场景越接近真实操作模拟越不可靠。这跟企业里测试环境跑得好好的一上生产就出问题是同一个结构。而验证黑箱对应的是你怎么证明你的数据是准的。企业做数据治理一个常见的困境是口径定了一堆、报表做了很多但没有办法证明某张报表的某个数字就是对的。最后只能靠相信。Aaru 的教训在这里格外有用回测准确不等于未来准确。企业在评估数据平台的时候同样容易犯这个错——“我拿过去三年的数据回测指标很漂亮”比如数据质量规则覆盖率 99%、血缘完整度 95%但这些只能证明它擅长复现过去的规则不能证明它能处理没见过的异常。这对应到具体的设计取舍上有几条是能直接用的AI 模拟的难题企业数据平台的对应可操作的判断标准剧场问题Agent 在表演不代表真实测试环境指标漂亮生产环境失真质量规则必须在真实生产数据上跑过不能只在测试集验证验证黑箱回测准≠未来准历史数据回测指标好但新业务/新口径就崩必须有漂移检测且漂移阈值要能被报警对齐维度缺失SocioVerse 四维度只对字段、不对业务语义数据血缘要能追到业务口径的来源不只是表的血缘闭包模拟的意义困境数据湖里堆了几千张表没人知道该用哪张需要**这个数字怎么算出来的可追溯到人和文档**成本随规模指数膨胀数据平台越做越重收益说不清每个数据资产都要有明确的消费方和使用率度量persona 要 2 小时深度访谈高质量元数据需要业务专家投入这笔投入必须被承认不能假装平台自己能搞出来MatrAIx 论文作者自己在结尾也明确保留了一点高风险决策与重大科学结论仍不可替代真人参与。这个克制值得尊重——用大模型扮演消费者去评价大模型驱动的产品真实人类被移出了回路这个闭环风险是明摆着的。具体到 SPARK 融合平台能做什么、不能做什么我想说清楚能做的把数据可不可信变成可执行、可追溯的流程。iPaaS负责接数据治理中心把质量校验和口径统一前置到入库之前全域守卫划权限边界。这些是硬功夫也是任何模拟/预测工作的地基——你不能拿一个不可信的数据源去训练任何模型。不能做的定什么算预测准确。MatrAIx 花93 位研究者、18,189 次评测才做出一个人格是否被正确表达的评估框架。这个标准的制定工作平台做不了。这一点和前两期讲的是同一个道理平台让判断标准可执行、可追溯但判断标准本身对不对仍需专家定。 一个可以直接用的判断清单如果你在评估要不要信一家 AI 模拟公司的结果这几条是从上面的核实里抽出来的先看它的准确率是谁说的。Simile 的 85%~99% 是自报、未经独立审计。这不是说它假而是说不能当成第三方结论采信。看它有没有跨场景验证。Simile 自己承认每个场景都要重新训练可迁移性未知。这和一个模型在 A 任务上准确率高是同一回事——能不能迁移是两码事。看它的分层准确率不看平均值。MatrAIx 的 91.5% 是平均数但 App 操作场景只有 83%。你关心的场景是哪个场景就看那个数字。警惕回测这个词。Aaru 回测 2020 年大选误差 0.5%2024 年押错了。这不是 Aaru 独有的问题——任何预测系统的回测准确率都只证明它擅长复现过去。看它的商业模式是卖模拟还是卖预测。卖模拟的公司Simile在赚咨询和调研的钱这些客户要的是更快的市场研究容错率高。卖预测的公司Aaru、Sooth Labs要在真金白银的决策上押注这才是需要极高准确率的地方也是最容易翻车的地方。 写在最后这期节目最让我反复想的是那个剧场的比喻。孟醒说的是最怕的是你搭了一个剧场所有人都在表演——但一万个人在表演不代表一万个人真的能做预测。这句话的结构恰好也是当下几乎所有 AI 应用的困境。模型在演示里表现完美Agent 在受控环境里表现出色评测分数一个比一个高——但这些都不能证明它在真实世界里做对了什么。而这个领域给出的一个诚实的答案藏在 Aaru 那次失败的细节里它的模型预测哈里斯会赢。押错了。但它的预测结果和真人民调的差距只有 5 个百分点而真人民调当月也把结果搞错了。也就是说——这一次的失败恰恰证明了这条路线可能真的有用。一个能在 2024 年 11 月初做出接近真实民调精度的模型它押错的可能不是能力问题而是真实世界里那些根本不在数据里的因素。这跟我上一期讲触觉时的判断是一致的技术的真实边界往往不在技术能力上而在世界到底能不能被这套技术观测到上。触觉领域卡在人手被传感器屏蔽了AI 模拟领域卡在长尾事件里人的反应从来没被数据记录过。所以 MatrAIx 团队那句克制的话是这整期节目里最该被记住的高风险决策与重大科学结论仍不可替代真人参与。83 亿个人格再准确也还是83 亿个模型对另 83 亿个模型的回答。剧场里的人再逼真剧场终究是剧场。只有把现实世界的信号不断接进来——经济的、新闻的、人的——它才有可能从剧场变成镜子。而这需要一个前提现实信号本身是可信的、可追溯的。这恰恰是数据平台存在的理由。参考资料MatrAIxarXiv:2608.042052026-08-04 提交93 位作者Simile Series B 公告及 TechCrunch / Citybiz / TodayStartupNews 报道2026-07-30Aaru 2024 年大选预测争议Semafor 报道2024-11-06Metaculus FutureEval 排行榜与季度AI Benchmarking Tournament 数据《硅谷 101》AI 开始预测人类83 亿虚拟人格、数字社会与一门押注未来的生意2026-09-10 上线片长 31 分 22 秒受访者观点为节目口述文中标注的纠错处均经独立检索核实
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进