大模型背后的数据供应商:Surge AI
第一次知道Surge AI这家公司是看到Edwin Chen的播客访谈,正值他们第一次出来融资,Edwin的几个观点让人印象深刻[1]:
- 不喜欢玩硅谷那套炒作游戏,更倾向于做正确的事而不是看上去很牛逼的事情
- 反对堆人力标数据的做法,专注做最高质量的数据并通过优化流程提高效率
- 指出公开benchmark(例如基于用户偏好的LMArena)并不work
对他们的观点十分赞同,一方面同样不喜欢公式化的创业路径,另外自己有过一段做AutoML的经历,为了提升效果高强度训练过很多模型,深知理解数据对模型效果的重要性。出于对这家公司的兴趣,本文对Surge AI的公司发展、团队、业务情况以及他们的核心观点进行了梳理。
Surge AI公司发展与团队
Surge AI成立于2020年(GPT-3发布后),与大部份硅谷公司的路线不同,创始人Edwin没有拿VC的投资,而是用自己在大厂上班的积蓄创建了公司,而且实现了一开始就盈利。Edwin在访谈中表示自己不喜欢硅谷的status game,融资、炒作、发推特搞圈子等等,而是想自己做一些正确的事情,而且也不希望拿了VC的钱后受制于人。
Surge AI一开始就提供高质量的数据标注(与廉价的大规模众包不同),而且后面新增了RLHF数据和工作流,以及质量控制、复杂rubric设计、领域专家标注、快速实验接口、红队工具等等专业服务。这套能力深度参与了Claude的训练:Anthropic需要为RLHF大规模扩充人类反馈,却被「去哪找合格标注员、如何搭质量控制系统、怎么维护标注工具」这些琐事拖住研究节奏,Surge AI正是接管了这一整条链路[2]——用自研的人机结合算法做质量控制(因为语言模型对低质量数据「极其敏感」,一批坏数据就可能让研究倒退),提供覆盖数学、编程、法律、医学、商业等领域的专家标注员,并把过去数百次内部实验沉淀出的RLHF方法论直接开放给客户。
公司2024年的营收已经超过10亿美元,并在2025年7月第一次计划融资10亿美元,估值在300亿美元左右。
CEO Edwin毕业于MIT,曾在Twitter(搜索/广告质量)、Google、Facebook/Meta 等做过数据科学/机器学习相关工作,对数据有深刻理解。整个公司的团队人数十分精简,核心团队不到100人,专注开发工具链、平台以及构建评估体系等,算上兼职人员和顾问大约250人左右,除此之外Surge AI也会与其他承包商合作完成人力密集的任务。
业务与案例
Surge AI的公开信息不多,在他们的blog中能找到一些案例:
为OpenAI构建的GSM8K数据集(2022)
这是一个包含8500道小学数学题的数据集,都是各种应用题,例如
鲍比拿到工资后,达伦的钱将是鲍比的两倍。鲍比目前有 40 美元,他将获得 16 美元的工资。达伦现在有多少钱?
GSM8K 服务于 OpenAI 强化学习团队训练模型的数学推理能力,因此对题目的约束非常具体:每题需要 2 到 8 步解答、只用加减乘除四则运算、计算量小到可以心算、最终答案为整数,同时场景要足够多样、避免重复[3]。为保证质量,Surge AI优先招募有STEM学位、数学能力过关的出题人,每个人的前5份提交都会由另一位合格的Surger复核;用「正确性」和「多样性」两条流水线把关——正确性上,每道题都让两名Surger独立求解,只要答案不一致就重点排查题面表述是否有歧义;多样性上,则对题目计算句向量并两两求余弦相似度,把相似度超阈值的题剔掉,防止场景撞车。这个数据集后来被 Google 的 PaLM、Chain-of-Thought 等论文广泛采用,成了衡量模型数学推理的基础基准之一。
Claude的训练与评估(2023)
Claude在模型训练与评估中,用到了Surge AI的这些feature[2]:
- 质量控制:用人机结合的算法在数据进入训练前拦掉低质量样本
- 领域专家的标注:跨数学、编程、法律、医学、商业、STEM 等方向的专业标注员,让模型能在各领域学到高质量的偏好反馈
- 快速实验接口:提供API和RLHF界面,研究员不用先花大量时间打磨标注指南就能快速发起标注任务、迭代实验
- 红队演练工具:由专门团队主动探测模型的安全漏洞
换句话说,Surge AI承担的不只是「标数据」,而是把RLHF所需的标注员招募、质量控制、实验平台、红队一整套基础设施打包交付,让Anthropic的研究员能专注在研究本身。
为Meta Superintelligence构建AdvancedIF(2025)
现在的公开benchmark其实和现实场景是脱节的,大家都在关注容易评估的指标(例如数字符)、而不是真正有用的指标。Surge AI与Meta Superintelligence Labs合作构建AdvancedIF这个指令遵循评估体系时,遵循以下原则[4]:
- 构建真正的评估目标,而不是简单的代理目标(例如「避免出现字母C」这种可程序化验证的约束很好衡量,但真正的写作与指令遵循能力很难衡量)
- 提示词和评分rubric全部由人类专家编写,而非LLM合成
- 评估需要足够灵活,而不是当作简单的选择题来处理
- 将复杂的多轮对话作为feature,因为用户在每一轮的对话中也是混乱的(例如中途修改约束、要求模型结合前文更新方案)
为了让这套人写rubric能规模化打分,团队还用数千条专家标注训练了一个verifier,与人类评分的F1一致性达到0.728,比直接用LLM打分高出41%。效果也很直接:Meta把这些人写的rubric当作RL的奖励信号来训练Llama 4 Maverick,模型在AdvancedIF上取得了6.7%的绝对提升,而且能泛化到没有参与训练的其他benchmark上。值得注意的是,即便是前沿模型,在这类真实指令遵循任务上的失败率仍高达22%~30%,说明「面向字符计数优化」和「面向真实意图优化」之间的差距依然很大。
其他模型评估分析
除了上面的客户案例之外,Surge AI的blog还有不少有意思的分析,例如金融任务和编程任务上的模型评估。
在金融评估中,Surge AI请来前交易员、投行、风控等专家,围绕巴塞尔资本计算、大宗商品交易、PowerPoint/Excel 文件操作等,跨7个领域设计了200多个真实场景,测了 GPT-5、Claude Sonnet 4.5 和 Gemini 2.5 Pro[5]。结果并不好看:GPT-5 成功率47%领先,Claude 26%、Gemini 24%,而且专家打分里超过七成的回答落在「平庸到糟糕」的区间。具体到任务上,要求制作金融风险的PPT时,Gemini 声称已生成却拿不出幻灯片、Claude漏掉了必要章节、只有GPT-5做完了整份但缺少风险缓释的说明;做Excel财务预测时,Gemini 直接编造计算并返回坏掉的链接、Claude在中途把公式改坏、GPT-5算对了却把所有格式都抹掉了;而在巴塞尔资本建模上,三个模型都用错了损失率、漏掉了对冲交易的抵扣规则。这些模型缺的不是课本知识,而是把知识落到专业实践中的那点「街头智慧」。
在编程评估中,Surge AI用 SWE-Bench 的 Bash Only 设定(只能用shell命令去解真实的GitHub issue,最强的模型也只有67%左右的通过率)测了 Gemini 2.5 Pro、Claude Sonnet 4 和 GPT-5[6]。任务本身只是修一个 astropy HTML 表格写入器忽略 formats 参数的bug,正确解法其实只要两行代码,但三个模型的幻觉轨迹截然不同:Gemini 在看到被截断的文件输出后,凭空发明了一个不存在的 BaseWriter 类和一堆虚构方法,在39轮、改动693行里追着幻觉出来的行号(声称在362-365行,实际在440行)反复打转,还坚称「我这套修复的核心逻辑是对的」,最终没能恢复;Claude 早期也犯了类似的继承关系错误,但它意识到运行时报错意味着更深层的问题,于是停下来重新评估、重新排查,最后找到了正确的修复;GPT-5 则通过显式验证假设完全避开了幻觉,遇到被截断的文件时先标记信息缺口、再深入排查,一次就干净地解决了问题。三种失败模式可以概括为:识别不出信息缺失、缺乏验证机制、以及在错误假设上一条道走到黑。

还有一个更简单的例子[7]:一位叫Josephina的老师只是想把一份政府PDF第4节的正文提取到Word里、去掉脚注和图注,ChatGPT和Gemini却都翻了车。ChatGPT先是没问清楚就返回了「摘要版」而非全文,接着生成的解析代码吐出以乱码「47」开头的内容,反复忘记「去掉脚注」的要求,每修一个问题又冒出新问题(修好间距就弄乱换行,删了脚注又搞坏格式),折腾25分钟后老师放弃了;Gemini则更离谱,在没有上传文件时幻觉出自己在分析随机的学术论文、编造根本不存在的Word下载链接、还去访问了随机的Google Drive文件。归根结底还是那几个老问题:不会验证工具输出、不会在歧义处主动追问、跨轮对话记不住指令、以及一不确定就开始编。
核心观点
公开Benchmark有很多问题
例如LMArena:输入一个题目,评估两个答案,然后选出最佳答案。
这实际上是面向人类的注意力进行优化,而非面向基本事实,因为普通人并不会去做事实核查,哪个更长或者表情包更炫酷就会投票给谁(ChatGPT也有这个机制),这实际上是很不合理的,但在社区很热门并被奉为圭臬,客户和投资人会参考这个排行榜的表现,迫使开发者面向不合理的评估体系进行优化[8]。
Surge AI给出的证据也很扎实:他们复核Arena的投票后,不认同其中52%的样本、对其中39%强烈不认同;投票者会偏好带幻觉的答案(例如错误的《绿野仙踪》引文)和数学上不可能的方案(例如尺寸对不上的蛋糕烤盘)。更糟的是这套机制可以被「刷」——大厂会A/B测试几十个变体、拿到不成比例的对战数据(Google和OpenAI各占约20%,而83个开源模型加起来才30%),还能利用每月约9%的重复提示去过拟合排行榜;Meta的Maverick甚至会用满是表情包的「非回答」去应付简单问题。除此之外很多其他benchmark也有一堆问题,例如「Humanity’s Last Exam」里面30%的回答都是错误的,HellaSwag中36%的回答是错误的,如果连评估指标都有问题,那训练出来的模型也不会好。
当前Agent的能力与人类常识还差很远
Surge AI把九个前沿模型放进一个模拟的PC零售商「Corecraft, Inc.」里、用150个客服任务做测试,从中提炼出一套Agent能力的层次框架[9]。如果把这些能力分成几个层次,目前的模型都做不到人类级别的常识推理:
- 基础的工具使用、规划与目标制定(把任务拆成步骤、选对工具、按顺序执行)
- 适应现实情况的能力(初次尝试失败后能否换个策略;例如客户查询时打错了字,是否能正确处理)
- 不脱离实际环境(紧贴当前对话的日期和上下文,不凭空捏造细节)
- 常识推理(推断出没有明说的需求;例如在客服任务中,根据用户提供的账户信息主动查询会员等级以提供个性化定价)

测试结果印证了这套框架:即便是 GPT-5 和 Claude Sonnet 4.5,也有超过40%的Agent任务失败,而且失败点各自分布在不同层级——弱模型连基础工具都用不好(例如 Nova 1 Pro 把「gold」当成客户ID直接传进去,而不是先调用搜索),强模型则栽在更高层的推理上(例如 Gemini 面对空的搜索结果就直接接受、而不尝试换个参数;Kimi K2 在任务中途把日期在2024和2025之间来回切换;GPT-5 没能从上下文推断出「Sarah Kim」指的就是那位客户)。换句话说,现在的模型能执行连贯的计划,却还很难对陌生情境做出真正的推理,离人类级别的自主能力还很远。
参考资料
- Lenny’s Podcast. The 100-person AI lab that became Anthropic and Google’s secret weapon — Edwin Chen (Surge AI). lennysnewsletter.com/…/surge-ai-edwin-chen
- Surge AI. How Anthropic and Surge AI’s RLHF Platform Trained an LLM Assistant with Human Feedback. surgehq.ai/blog/anthropic-surge-ai-rlhf-platform
- Surge AI. How We Built It: OpenAI’s GSM8K Dataset of 8,500 Math Problems. surgehq.ai/blog/how-we-built-openais-gsm8k-dataset
- Surge AI. AdvancedIF and the Evolution of Instruction-Following Benchmarks. surgehq.ai/blog/advancedif-instruction-following-benchmarks
- Surge AI. Finance Eval: How Frontier Models Handle Real-World Finance Tasks. surgehq.ai/blog/finance-eval-real-world
- Surge AI. When Coding Agents Spiral into 693 Lines of Hallucinations. surgehq.ai/blog/coding-agents-693-lines-of-hallucinations
- Surge AI. The PDF That Broke ChatGPT. surgehq.ai/blog/the-pdf-that-broke-chatgpt
- Surge AI. LMArena Is a Plague on AI. surgehq.ai/blog/lmarena-is-a-plague-on-ai
- Surge AI. RL Envs: How Frontier Models Handle Real-World Agentic Tasks. surgehq.ai/blog/rl-envs-real-world