AI应用的投资人消失了?一个反直觉的案例
Harvey,一家成立了四年的法律AI公司,在60个国家运营,客户全是全球顶级律所,但创业之初的处境是地狱级开局:
没有训练数据
——律所的数据受律师-客户特权保护,绝对不能碰,一个字都不能 没有顶级人才
——OpenAI给研究员开亿元薪酬包,它抢不过 没有算力底座
——玩不起大模型
它要跟谁竞争?OpenAI、Anthropic、Google DeepMind——这个星球上资金最厚、人才最密、算力最强的三支队伍。
任何一个正常的商业逻辑都会告诉你:这仗没法打。但Harvey的联合创始人Gabe Pereyra说了一句反常识的话:"我们不玩你们那个游戏了。"
他的打法,用一个词概括就是:点球成金(Moneyball)---上了年龄的“老登"大概率看过这个电影!
一、旧共识的三个裂缝
为什么应用层公司"注定打不过"顶级实验室?市场共识有三个理由。但Gabe发现,这三条在垂直场景里,每一条都有裂缝。
裂缝一:算力碾压?——开源模型已经把地基抹平了。
共识:OpenAI有百万卡集群,你拿什么比?
现实:开源模型(GLM 5.2、NeMo-Megatron)已经强到——拿过来做post-training(后训练),就能推到前沿水平。Harvey不需要从零训大模型,它只需要在别人的地基上盖自己的楼。
裂缝二:人才碾压?——API把人才门槛打穿了。
共识:你抢不到DeepMind的研究员,怎么跟人家拼?
现实:Fireworks、Baseten这些公司把推理基础设施做成了API——你不需要招几百个ML工程师,你只需要几个会用API的人。基础设施外包,人才门槛骤降。
裂缝三:数据碾压?——没有数据反而是最大的护城河。
共识:没有数据训练,你就只能做表面功夫。
现实:客户的私有数据不能用,恰恰意味着别人也用不了。 当所有通用模型都在用公开数据训练时,Harvey的护城河变成了"帮律所在自己的私有数据上训练定制模型"——这件事,OpenAI做不了,因为律所不会把特权保护的数据交给它。
三个裂缝拼在一起,结论惊人:通用模型的战争是巨头的主场,垂直场景的战争是应用层的主场。
二、三张王牌:尺子、假数据、外包
Harvey真正赢下的,是三个"不性感但致命"的环节:
第一张牌:造尺子——开源Benchmark,定义行业标准。
没有好的评估基准,你连"好"都定义不了,更别说训练和部署。所以Harvey干了件反直觉的事——把自家评估数据集开源了:
LegalAgentBench
:1200个客户任务、24个法律领域、75000条专家编写的评分标准 LAB Contracts
:500个合同谈判任务 LAB Diligence
:8000万token的最大型data room环境之一
为什么不藏起来?因为开源的benchmark会被社区和顶级实验室拿来评测,反过来帮你打磨标准——你在定义整个行业的尺子。谁定义了尺子,谁就掌握了"前沿"的解释权。
第二张牌:造”假数据“——用rubric引导生成合成数据。
没有真实数据怎么办?合成。
做法很巧妙:从评分标准(rubric)出发,故意埋进矛盾条款和缺失内容,生成一个自洽的data room,再用Mercor/Snorkel等工具拟真——造出来的数据比真实数据更"标准",因为是按你的尺子造的。
这招的灵感来自Brendan(Reka)的"vibe coding"类比:就像AI写代码,你不需要它每一步都对,你只需要它整体能用——生成数据也一样。
第三张牌:生态外包——把非核心全扔给neo labs。
Harvey养不起全栈团队,但它有一整个"前沿生态系统"可以借力:
Fireworks管推理路由 Baseten管推理部署 Trajectory管后训练 N-gram管KV缓存压缩 Applied Compute帮训GLM-5.1
Gabe把生态外包形容为"不是认输,是把非核心能力租出去,集中火力打核心战场"。
核心战场是什么?是私有数据定制——这才是OpenAI们碰不到的护城河。
让数据说话,Harvey做RL训练的验证成本对比:
用DeepSeek batch验证:约18美元 用Claude Opus验证:每个标准约18000美元
这不是抠门,这是战略——当你的验证成本比别人低1000倍时,你可以做的实验数量比别人多1000倍,你的迭代速度就比别人快一个数量级。
更狠的是组合拳:GLM 5.1(开源底座)+ Opus 4.7 advisor(裁判)——用便宜模型干活、用贵模型当裁判,最终成本和质量组合,击败了直接用Claude Opus的配置。
这就像《点球成金》里的奥克兰运动家队:不跟你拼钱,跟你拼评价体系。 当全联盟都在用"打击率"选人时,他们用"上垒率"——一个别人忽略的指标——用1/10的预算打出了同样的战绩。
Harvey做的,就是AI时代的奥克兰运动家队。
三、真正的护城河:数据特权保护的悖论
把Harvey的打法放进更大的坐标里看,最反直觉的洞察是这个:
越是数据隐私严苛的行业,应用层公司的护城河越深。
法律:律师-客户特权,数据不能出律所 医疗:HIPAA,数据不能出医院 金融:监管要求,数据不能出机构
在这些行业里,通用模型永远只能做"泛泛的聪明",而应用层公司可以在客户的私有数据上训练定制模型——这是一个OpenAI们物理上无法进入的房间。
这就是超垂直路线的价值:不是在大模型的地盘上跟它抢,是在它进不去的房间里建立自己的垄断。
而终极壁垒,是Gabe承认"还没解开的难题"——持续学习(continual learning)飞轮:当你在客户的私有数据上不断训练、不断迭代、不断积累,你和客户之间的绑定会越来越深——客户用你越久,你的模型越懂他;你的模型越懂他,他越离不开你。
这是所有AI公司梦寐以求的复利曲线,而Harvey正站在它的起点。
- 暂时没有评论,来说点什么吧





