前言常见的多智能体框架有几类有智能体相互沟通配合一起完成任务的例如ChatDevCAMEL等协作模式, 还有就是一个智能体负责一类任务通过选择最合适的智能体来完成任务的路由模式当然还有一些多智能体共享记忆层的复杂交互模式这一章我们针对智能体路由也就是选择最合适的智能体来完成任务这个角度看看有哪些方案。上一章我们讨论的何时使用RAG的决策问题把范围放大把RAG作为一个智能体基座LLM作为另一个智能体其实RAG决策问题也是多智能体路由问题的一个缩影。那实际应用场景中还有哪些类型的智能体路由呢不同角色的智能体例如看到最搞笑的是不同流派的算命机器人不同工具挂载的智能体例如接入不同知识库拥有不同领域工具不同思考方式的智能体例如COT思考有Step-back思考有outline思考不同工作流的智能体例如例如不使用RAG使用单步RAG多步RAG的智能体路由把以上融合也就是不同角色工具思考方式工作流的综合智能体路由而这里我们看两种外挂策略也就是可以直接在当前已有多智能体外层进行路由的方案。基于能力和领域的智能体路由One Agent To Rule Them All: Towards Multi-agent Conversational AIhttps://github.com/ChrisIsKing/black-box-multi-agent-integationMARS其实是一篇大模型出现前的文章但是却可以作为多Agent路由的基础文章之一它主要针对当不同领域能力的智能体选择。思路非常清晰。论文先定义了多智能体选择问题该问题的组成元素包括query 用户提问agent skill对于智能体能力的描述也可以是sample queriesagent response智能体对用户提问的回答那自然就有两种智能体选择的方案一个是直接基于query进行选择Query-Pairing一个是基于智能体response进行选择Response-pairing当前的多智能体决策也就是这两个大方向前者更快但精度有限后者更慢但效果更好。下面说下方案中的细节因为实际操作时你会发现两个方案都有难点。Question pairing基于query进行判断的问题在于如何描述agent能干啥论文指出智能体的能力边界不好界定更难描述。论文给出的一个方案是使用query sample虽然不知道模型的全局能力但是基于用户历史的使用情况可以知道模型能回答哪些query例如locate me some good places in Kentucky that serve sushi这个问题“Alexa”, Google可以回答这个问题。那就可以基于历史收集的query样本训练一个多标签分类模型预测每个query哪些智能体可以回答。其实这种方案也是使用了response只不过使用的是历史agent回答。除了query分类论文还用了相似度。论文收集了agent在公开网站上的能力描述例如Our productivity bot helps you stay productive and organized. From sleep timers and alarms to reminders, calendar management, and email ….然后使用agent描述和query的文本相似度排序作为agent能否回答该问题的判断。这里论文尝试了bm25USE还有微调Roberta等方式进行向量编码。之前我们也考虑过类似KNN的方案但这种方案有个问题在于文本相似可以衡量领域差异例如数学Agent金融Agent但是无法区分任务复杂程度所以不适用于领域之外的其他agent路由场景。Response Pairing使用在线模型回答来进行路由的核心难点其实就是如何判断response质量论文指出的是前文多通过response和query的相似度来判断这是不够的还要判断准确性因此论文采用了cross-encoder训练了query-response ranking模型。不过在大模型出来后的这两年对于response回答质量有了更全面的评价标准例如OpenAI的3HHelful, Harmless,HonestyDeepMind更关注的2Hhelpful, harmless,也有了更多的Reward和Judement模型的训练方案。这里就不细说论文的方案了直接来看下效果吧。论文在22年当时的四大AgentAleax,Google,houndify,Adasa上评估基于Response排序的方案最好不过使用Query Sample分类的方案效果也不差。基于问题复杂程度的智能体路由Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity前面的MARS更多是从领域层面对智能体进行划分例如bank agentweather agenttransport agent但是RAG问题上领域差异更多只影响数据库路由也就是使用哪些召回查什么数据。还有一个更重要的差异来自问题的复杂度。类似的方案有SELF-RAG不过它是把路由融合在了模型推理的过程中整体复杂度太高可用性就有些低了。所以我们看下Adaptive-RAG的外挂路由的方案。Adaptive-RAG提出了通过分类器对query复杂程度进行分类并基于分类结果分别选择LLM直接回答简单单步RAG或者复杂多步RAG论文选择了Interleaving-COT如下图那如何判断一个query的复杂程度呢这里其实和前面MARS提出的query pairing中的query多标签分类模型的思路是相似的。也是使用同一个query3种模式的回答结果的优劣作为标签来训练分类模型当然也可以是listwise排序模型。论文使用的是有标准答案的QA数据集因此多模型回答的结果判断起来会比较简单这里3种回答方式也有优先级那就是更简单的链路能回答正确的话默认标签是最简单的方案。这里的query分类器论文训练了T5-Large样本只有400条query以及每个问题对应在3种链路上的回答结果。而在现实场景中RAG样本的反馈收集要复杂的多需要先基于标注样本训练Reward模型得到对回答质量的评分再使用Reward模型对多个链路的回答进行打分从而得到分类标签。如果你的RAG链路选择更多优先级排序更加复杂的话不妨使用多标签模型得到多个候选agent再基于多个agent之间的优先级选择复杂程度最低或者在该任务上优先级最高的Agent进行回答。效果论文分别在single-step和multi-hopQA数据集上进行验证Adaptive都能在保证更优效果的同时使用更少的时间和步骤完成任务Oracle是当分类器完全正确时的效果比较天花板基于用户偏好的智能体路由ZooterRouting to the Expert: Efficient Reward-guided Ensemble of LargeLanguage Models第三篇论文是从用户回答偏好出发选择最合适的agent其实也是最优的基座模型。基座模型Ensemble和Routing也算是智能体路由中的一个独立的方向包括的大模型小模型路由以求用更少的成本更快的速度来平衡效果也有多个同等能能力的模型路由来互相取长补短。个人认为基座模型的路由比不同领域的Agent或者rag要复杂一些因为基座模型间的差异在文本表征上更加分散抽象难以进行归类和划分。这差异可能来自预训练的数据分布差异指令数据集的风格差异或者rlhf的标注规则差异等等~正是因为难以区分所以基座模型路由要是想使用query-pairing达到可以和response-pairing相近的效果和泛化性需要更多更丰富的训练数据。Zooter给出的就是蒸馏方案也就是训练reward模型对多模型的回答进行评分然后把模型评分作为标签来训练query路由模型。如下蒸馏部分论文借鉴了蒸馏损失函数为了从reward模型中保留更多的信息这里没有把多模型的reward打分最后转化成top-answer的多分类问题而是把reward打分进行了归一化直接使用KL-divergence让模型去拟合多个模型回答之间的相对优劣。同时考虑到reward-model本身的噪声问题论文在蒸馏时也使用了label-smoothing的方案来降低噪声提高模型回答置信度。其实也可以使用多模型reward打分的熵值来进行样本筛选。奖励函数论文使用QwenRM作为reward模型混合多数据集构建了47,986条query样本对mdeberta-v3-base进行了蒸馏训练。效果上论文对比了6个单基座模型使用蒸馏后的模型进行query路由ours以及使用不同Reward模型对response进行路由还有SOTA GPT3.5和GPT4不同Reward模型的效果差异较大在当前评估的4个任务集上Qwen和Ultra的效果要显著更好论文蒸馏的方式训练的Zooter模型在query路由的效果上可以基本比肩使用RM进行response路由使用1/6的推理成本就能做到相似的效果有相似的推理效果最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】