

蓝耘近期低调上线了一款名为 automodel 的新模型,思路很直接:把五个当下最强的基座模型塞进同一个入口,由后台统一调度。这五个模型分别是 Gemma3-27B、Qwen3-VL-32B-Instruct、DeepSeek-V3.2、MiniMax-M2.5 与 GLM-5.1,覆盖文本、视觉与长文档等多种能力。

这种「模型路由器」的玩法并不新鲜,核心逻辑是:你抛出问题,后台判断哪个模型最擅长,就把任务派给谁。写代码交给 DeepSeek,视觉问题交给 Qwen3-VL,长文分析交给 GLM,理想情况下每个问题都能匹配到最合适的那位选手。

但口号归口号,真实表现如何,还得拉出来测。

接入只需三分钟

笔者用 Cherry Studio 完成了接入,整个过程不到三分钟。打开模型服务面板,点击左下角添加按钮,在弹窗里填入两项信息:API 地址填写 automodel,API KEY 则前往蓝耘 MaaS 控制台,在系统管理下的 API KEY 管理中创建并复制以 sk-ak 开头的密钥。粘贴后点击右侧对勾检测,看到绿色「连接成功」即可。

相比很多复杂模型的接入门槛,这一步确实没有添堵。

三道题,五位选手同台

为了检验 automodel 的调度是否真的做到「任务级最优」,笔者设计了三道难度递增的题目,分别考察推理、代码与综合调度能力——这恰好是路由模型最容易被质疑的短板。

第一题,逻辑推理。 题目是经典的说谎者逻辑陷阱:A、B、C 三人中有一人说谎,各自给出相互指认的陈述,要求逐步推理谁说真话。把同一题分别丢给 automodel、DeepSeek 与 GPT,三家结论一致(B 说真话,A、C 说假话),但风格有别。DeepSeek 额外指出「若坚持只有一名说谎者则题目条件无解」,说明它把题目当逻辑问题真正拆解了;automodel 的推理过程与 DeepSeek 高度相似,细节显示它在此类任务上调用的正是 DeepSeek-V3.2 底座,路由判断准确。

第二题,代码生成。 要求用 Python 单文件实现 LeetCode 第 41 题(缺失的第一个正数),限制 O(n) 时间与 O(1) 空间,且不得借助第三方库。三家都采用了原地哈希的思路:将 nums[i] 归位到 nums[i]-1 的位置,再扫描找第一个不满足的下标。代码高度相似,变量名与注释风格略有差异。这也从侧面印证,automodel 在代码任务上大概率调用了 DeepSeek 或 GLM。

第三题,混合任务。 要求分析一句英文的语法错误、用英文重写,并附上一段输出结果的 Bash 脚本。这道题同时考察语法纠错、跨语言改写与脚本生成,正是路由模型调度能力的试金石。automodel 在一次对话内把三件事全办妥了:准确指出主谓不一致与语序问题,重写为「He doesn't know where the nearest bank is.」,并给出用 corrected_sentence 变量承接结果的工程化脚本。它没有明显把子任务拆碎丢给不同模型,而是作为整体派给最合适的那位。

真上生产环境

纸面测试之外,笔者把 automodel 接入了一个用 Next.js 编写、已开源的「AI 人生规划师」项目,替换原本单一模型驱动的核心对话。接入后按问题类型自动分派:职业规划交给 DeepSeek,学习成长建议交给 Qwen,财务规划交给 GLM。运行两天,最明显的变化是回答多样性提升,不再是一个固定腔调。
写在最后
坦率说,automodel 并不完美。三道题都是单回合测试,未涉及长对话记忆、多模态、Agent 工具调用等更复杂的场景。但作为一个「五合一」路由模型,它的表现足以改变笔者此前的偏见——过去总觉得把几个二线模型拼起来是「打不过单兵王者的无奈之举」。
如果路由调度真能做到任务级最优,那么「五个 90 分的模型」或许比「一个 99 分的模型」更实用:90 分的覆盖面更广,99 分可能只在单一领域特别突出。下次有人问「该用哪个模型」,不妨先反问一句:你的问题是单一的,还是混合的?单一垂直问题挑领域王者,混合问题,这类路由模型值得一试。

评论0