Salesforce为何后训练自己的企业推理模型:Koa基于NVIDIA Nemotron 3 Super,专攻多步企业推理

来源:Salesforce 链接:查看
0 评论 180 浏览 0 收藏

通用模型理解退款政策的方式,和它理解一道物理题的方式是一样的。因此,Salesforce 专门为企业工作训练了

通用模型理解退款政策的方式,和它理解一道物理题的方式是一样的。因此,Salesforce 专门为企业工作训练了一个模型。

在 Agentforce 的大部分历史中,几乎每一项任务都由一个通用模型负责推理:意图识别、提示注入筛查、毒性检测、评估、重排序等等。过去十八个月里,Salesforce 改变了这一做法,构建了一系列更小的模型,每个模型专注一项具体工作,但所有核心的多步推理仍然交给通用模型。现在,这一局面正在改变。

Koa 是 Salesforce 首个针对企业工作优化的 AI 推理模型,运行在 Salesforce 信任边界之内。Salesforce 与 NVIDIA 联合工程打造 Koa,对其 NVIDIA Nemotron 3 Super 模型进行后训练,使其适配最常见的企业任务。客户现在可以使用 Koa 来驱动其 AI 智能体的业务流程。

面向企业工作的推理模型

推理是智能体思考复杂问题、评估自身逻辑、决定调用哪些工具并在给出答案或执行动作之前验证路径的方式。前沿模型可以做到这一点,但它以同样通用的智能去处理退款政策、物理题和差旅计划,每一项都从第一性原理出发推演。这种广度是通用模型的价值所在,也是它的局限:前沿模型是从外部推理你的业务,把宽泛的智能套用到它从未真正做过的工作上。

想想一个人是如何变得擅长本职工作的。新员工通过入职培训学习政策与流程、授信阈值与合规红线,学习公司判定线索、批准退款的具体规则。然后在反复实践中把这些内容烂熟于心,并加以应用。这就是专业能力:一套规则与来之不易的实践经验,在工作中学到,并被一致地运用。

而通用模型永远从第一性原理出发。每次接到任务,它都从头推演,哪怕已经做过一千次。由于它的推理是概率性的,每次的做法可能并不一致。这对需要创造性的任务是好事,但对受治理、可重复的工作而言,更需要一个学会了确切工作内容、并且始终运用这些专业能力的模型。这正是 Salesforce 要打造的模型。

如何构建

从零训练一个推理模型需要海量数据与时间。幸运的是,NVIDIA 已经构建了 Nemotron 3 Super——一个 1200 亿参数的开放模型,它带来了闭源前沿模型无法提供的两样东西。其一是对模型权重的直接访问,使 Salesforce 可以后训练并将其适配到确切的目标工作;其二是可溯源:NVIDIA 公开了 Nemotron 的训练数据集,因此 Salesforce 能够看清基础的构成,而不是听信厂商的一面之词。这为客户提供了可信的骨干——一个开放、在美国训练、由 Salesforce 掌控并可审查的模型,而非黑盒。

教模型学会一项工作有两种方式。第一种是让它模仿成功完成工作的过程记录,也就是业内默认的监督微调。这就像照着手册入职:阅读并记住工作是如何完成的。但这种方法收益有限,因为企业智能体运行的是多轮、使用工具的工作流,复杂到无法只靠阅读学会。

于是 Salesforce 让模型亲自去做。团队在制造、金融服务、医疗健康、旅游等 14 个以上行业中构建了模拟企业工作流,生成了带有情绪与人设的合成客户——有的配合,有的不满。工具对智能体的调用作出响应,由评审员判断客户的问题是否真正得到解决。如果没有,模型就重试,把每个场景运行数千次,努力提高得分。这种强化学习方法提升了最关键的能力:多轮工具调用,即把一项任务跨多个步骤、多个工具、多轮对话推进下去的能力。

为此,Salesforce 调动了 27 年运营同类工作流的经验:团队深知服务升级内部是什么样子、线索资格认定究竟涉及什么、当客户在另一端等待时「已解决」意味着什么。这些知识是通用模型从未拥有过的,而正是 Salesforce 能赋予 Koa 的东西。

有一个场景值得特别一提,因为它是企业最担心的:在模拟中,团队故意让模型处于正确工具不可用的境地——客户提出智能体当前做不到的请求。此时通用模型往往含糊其辞:调用一个名字相似、却会改动不该改动数据的工具,甚至更糟,确认一个从未发生的动作。Salesforce 训练 Koa 像一个好员工那样回应:停下来,坦率告诉客户自己还不能做什么,请求所需的支持,并在时机成熟时接回任务;当情况需要模型不该独自作出的判断时,把工作移交给人类同事。知道何时不行动,同样是企业级专业能力。

以智能体每天都在做的工作为例:判定一个新线索的资格。这不是开放式任务。公司有明确的合格线索定义、核对账户历史与企业属性的流程、转入销售的阈值,以及线索不达标时的处理规则。通用模型从外部推理这些规则与定义,每次可能得出略有不同的结论;而在真实业务上训练过的模型,对第一百个线索的判定与第一个完全一致。这就是「对资格认定这件事聪明」与「像你的企业那样认定线索」之间的区别。

Koa 并不孤单。它建立在 Salesforce 工程与 AI 研究院开发的领域专用模型组合之上,包括 HyperClassifier、TextEval 以及最近的 Moirai。通过在这些专用模型与前沿大模型之间进行编排,意图分类、毒性筛查、搜索重排序等定向任务被路由给为它们而生的模型,Koa 则专注处理多步企业推理。

初步成效与数据边界

Koa 已经在 Salesforce 内部的员工工作流中运行,并正进入小规模客户试点,被用于服务、销售与电商场景的智能体。在更新商机、分派工单、安排跟进等 CRM 具体任务上的早期基准测试令人鼓舞,表现优于最强的通用模型。

Koa 完全运行在 Salesforce 信任边界内、由 Salesforce 运营的基础设施之上,客户数据始终在客户掌控之中。训练 Koa 所用的模拟工作没有使用任何真实客户数据:无论是服务台、合成客户还是评分结果。保护客户数据是 Koa 构建过程的核心,也是它运行的原则:你的数据与推理轨迹永远不会被用于训练模型。你的智能体如何推理你的业务、你的公司实际运转方式的积累模式,才是竞争对手无法复制的优势。在租用的前沿模型上推理,这些轨迹会成为改进模型、服务所有客户的燃料;而在 Koa 上推理,你的数据与轨迹只属于你。

面向眼前工作选择合适的智能,并拥有决定权。这已经是金融服务、医疗健康、旅游、会计等受监管行业的试点客户正在作出的选择——在一个为企业工作优化的模型上运行智能体。

收藏 0打赏 0评论 0
评论
  1. 暂时没有评论,来说点什么吧