结合你之前长期探索的 Agent Harness 架构设计、Hermes Skill Runtime 三层加载机制、多Agent调度与MCP扩展的相关背景,DeepSeek Harness 接入 GLM、MiniMax 等第三方模型的核心思路是在不修改原有Harness核心调度逻辑的前提下,通过统一模型适配层完成多模型协议归一化,实现不同大模型的无缝插拔接入,完全适配你日常指挥十几个Agent并行运行的生产级场景。
一、 核心架构改造思路
完全遵循你之前落地的“状态隔离、低侵入、Token成本可控”的工程化原则:
新增模型适配中间层:在Harness原有核心调度逻辑和模型API之间,新增一层统一的模型协议转换层,所有第三方模型的请求、响应都先经过该层做格式归一化,无需改动Harness内部的Skill调度、上下文管理核心代码。
保留原有DeepSeek原生链路:默认保留DeepSeek模型作为主链路,第三方模型作为可选扩展接入,不影响原有已上线Agent的正常运行。
统一错误重试机制:在适配层内置统一的限流、超时、重试逻辑,不同模型的API调用异常统一收敛处理,避免单个第三方模型故障导致整个Harness集群崩溃。
二、 分模型接入关键实现要点
接入MiniMax系列模型
直接复用你之前实测过的MiniMax官方SDK,在适配层将Harness发出的OpenAI格式请求,转换为MiniMax要求的messages数组格式,同时自动映射MiniMax特有的model参数(如abab6.5s、abab7)。
适配MiniMax的多模态输入格式,将Harness传入的图片Base64自动转换为MiniMax支持的图片URL/Base64入参格式,无需修改上层Agent的多模态调用逻辑。
自动处理MiniMax的Token统计规则,返回给Harness的Token消耗数据和DeepSeek模型保持统一口径,方便你做全集群的Token成本核算。
接入GLM系列模型
适配GLM官方的OpenAI兼容接口,仅需修改API端点地址和请求头中的鉴权字段,即可快速完成基础接入。
针对GLM特有的工具调用(Tool Call)格式做适配转换,将GLM返回的工具调用结果,转换为Harness原生支持的标准Tool Call结构,上层Agent的Skill调用逻辑完全无需修改。
兼容GLM的长上下文窗口特性,自动适配不同GLM版本的最大Token限制,避免请求被模型端直接拦截报错。
三、 工程化落地保障措施
模型路由策略:支持在Harness的Agent配置文件中指定单个Agent绑定特定模型,也可配置全局负载均衡策略,将不同类型的任务自动路由到最合适的模型上,比如代码类任务走DeepSeek,创意生成类任务走GLM,多模态任务走MiniMax。
密钥安全隔离:所有第三方模型的API密钥统一存入Harness的配置中心加密存储,不暴露给上层Agent,同时支持按Agent维度做模型调用权限管控,避免密钥泄露和滥用。
可观测性埋点:在适配层内置全链路监控,统计每个模型的调用成功率、平均响应延迟、Token消耗数据,方便你实时对比不同模型的性能表现,快速定位接入后的异常问题。
降级兜底机制:当某一个第三方模型的服务不可用时,Harness可自动将该模型上的任务切换到备用模型上执行,保证多Agent集群的整体可用性不下降。
这套接入方案完全贴合你之前探索的Agent Harness Gliding Horse版本的架构设计思路,几乎零侵入地扩展多模型支持,大幅提升你整个Agent集群的模型选型灵活性。
需要我为你生成DeepSeek Harness接入多模型的核心适配层代码框架吗?直接可以基于你现有架构快速二次开发。