五合一路由大模型实测:三道刁钻题看调度能力

文章配图

五合一路由大模型实测:三道刁钻题看调度能力

文章配图

蓝耘近期低调上线了一款新模型,名为 automodel。它的特点是能一次调用五个顶级大模型来解题,宣传上号称"任务级最优"。这种模型路由器的玩法其实不算新鲜,前两年就有厂商尝试过:把问题抛过去,后台判断哪个模型擅长这个领域,就派它上场。

理论上,代码生成让 DeepSeek 出马,视觉问题交给 Qwen3-VL,长文档分析由 GLM 顶上——每个问题都能找到最对口的那位选手。但实际效果如何,还得拉出来遛遛。

文章配图

接入体验:三分钟搞定

我用 Cherry Studio 接入 automodel,整个过程大约三分钟。打开 Cherry Studio,在模型服务区域点击添加按钮,填入 API 地址和模型 ID(automodel)。

文章配图

API KEY 需要去蓝耘的 MaaS 平台获取:打开蓝耘控制台,进入系统管理中的 API KEY 管理,创建密钥后复制 sk-ak 开头的字符串,回到 Cherry Studio 粘贴。点击对勾按钮检测,出现绿色"连接成功"提示即完成。

接入流程比预想简单。复杂模型通常意味着复杂的接入成本,但 automodel 至少在接入这一关没有添堵。

文章配图

三道刁钻题,五位选手上擂台

我准备了三道题,难度逐级上升,分别考察推理能力、代码能力、综合调度能力。之所以挑这三块,正是因为路由模型最容易被诟病的地方:五个模型来回切换,调度能否切对?会不会把简单问题扔给最贵的模型?能否真正做到"任务级最优"?

文章配图

第一题:逻辑推理

题目是经典的逻辑陷阱题:"A、B、C 三人中有一个说谎者。A 说 B 在说谎,B 说 C 在说谎,C 说 A 和 B 都在说谎。请一步步推理出谁在说谎。"

文章配图

我把同一道题分别扔给 automodel、DeepSeek 和 GPT。automodel 给出"B 说真话,A 和 C 说假话"的答案,推理过程完整,从假设到验证再到结论一步步展开。DeepSeek 给出相同答案,但额外补充一句"如果坚持只有一个说谎者,则题目条件无解",说明它真正把题目当作逻辑问题拆解。GPT 则列出三种假设情况,逐一排除后指出题目本身存在条件不满足的问题。

三家核心逻辑都对,只是表述不同。值得注意的细节是,automodel 处理这类长链逻辑时明显调用了 DeepSeek-V3.2 底座(推理风格几乎一致),说明后台路由判断是准的——它知道这种任务该派谁上。

文章配图

第二题:代码生成

题目是 LeetCode 第 41 题:"用 Python 写一个单文件函数,输入 List,不借助第三方库,在 O(n) 时间和 O(1) 空间内找出未出现的最小正整数。"

文章配图

DeepSeek 用原地哈希思路实现,把 nums[i] 放到 nums[i]-1 的位置再扫描,代码优雅、注释清晰。GPT 方案思路相近但交换条件写法不同。automodel 给出的代码与前两家几乎是同一套路,只是变量名和注释风格有差异。

这个结果合理——这道题有标准最优解,三家都奔着最优解写,自然相似。但反过来看,也说明 automodel 在代码任务上大概率调用的是 DeepSeek 或 GLM。不管调用谁,结果是准确的,边界条件考虑到了,效率符合要求,这就够了。

文章配图

第三题:混合作业

第三题故意设计得很刁钻:"分析这句话的语法错误,并用英文重写,最后附带一段可输出重写文本的 Bash 脚本。'He don't know where is the nearest bank.'"

文章配图

这道题同时考察语法纠错、跨语言改写、脚本生成三件事,正是路由模型最考验调度能力的场景。

automodel 在一次对话里全部完成:语法错误找得准(主谓不一致和语序问题都指出),英文重写为 "He doesn't know where the nearest bank is.",并给出 Bash 脚本。对比 GPT 和 DeepSeek,三家都能完成,但 automodel 的脚本用 corrected_sentence 变量承接结果,比直接 echo 更工程化。

文章配图

这种混合任务能一次给齐,说明路由系统没有把任务拆碎,而是当作整体派给了最合适的模型——这是最让人意外的一点。很多路由模型遇到复杂任务就会犯迷糊,要么拆给多个模型导致上下文丢失,要么全塞给最贵的浪费资源,automodel 至少没出现明显的调度事故。

真上生产环境

文章配图

做完三道题,automodel 至少是及格线以上。但光做几道题不够,最终要落到真实业务里。

我手上有个开源项目 AI 人生规划师(Next.js),核心对话原本由单一模型驱动。这次把 automodel 接进去,让它根据问题类型自动派给不同子模型:职业规划问题由 DeepSeek 回答(逻辑严密),学习成长建议由 Qwen 回答(调性活泼),财务规划由 GLM 回答(更专业)。

文章配图

跑了两天,效果确实有改善——最明显的是回答多样性上来了,不再是单一模型的固定腔调。

写在最后

坦率地说,automodel 并不完美。三个测试都是单回合,没有长时间对话记忆评估,也没覆盖多模态、视频理解、Agent 工具调用等复杂场景。

但作为"五合一"路由模型,它在三道刁钻题上的表现,让我对这种产品形态有了新的看法。过去我对"模型路由器"有点不屑,总觉得是把好几个二线模型拼在一起,看起来全面、其实每项都不精。

这次实测让我意识到可能有偏见。 如果路由调度真的能做到任务级最优,那"五个 90 分的模型"可能比"一个 99 分的模型"更实用——90 分覆盖的领域更多,99 分只在一个领域突出。

下次再有人问"我该用哪个模型",我会多问一句:"你的问题类型是单一的还是混合的?"如果是单一垂直问题,就挑那个领域的王者;如果是混合问题,路由模型可能真的值得一试。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?