2026 年 10 月 7 日的微软发布会把三件事捆成了一个包:137B 参数的编码模型宣布可以下载到本地运行,GitHub 的多模型路由器 HydraFusion 把本地模型纳入调度,Agent 执行沙箱 MXC 宣布正式 GA。官方给这套组合起的名字是 hybrid intelligence。
端侧模型讲了两年,这次的差别在量级:端上去的不是 7B 级别的补全玩具,而是能在部分编码任务上对标云端旗舰的 MoE 模型。但决定它能不能真正用起来的,是两个不那么性感的问题——内存账单怎么算,放出去的 Agent 谁来管。
量化与投机解码:53GB 的两根杠杆
模型本体是 Mixture-of-Experts 结构:总参数 137B,每个 token 激活 6.8B,上下文窗口 256K。端侧版本靠两个手段瘦身——量化把权重位宽压到约 3.3 bit/weight,静态体积降到 53GB 上下,只有 bfloat16 云端版的两成;投机解码 DFlash2 让小草稿模型成块提议 token、目标模型校验,压的是端到端延迟。运行时落在 Windows ARM64 的 llama.cpp CUDA 栈上,Windows ML 也开始兼容 llama.cpp。
实测数字(厂商自测口径,无独立复现,看的时候自带滤镜):Surface Laptop Ultra 的 RTX Spark 顶配 128GB 统一内存,256K 满载峰值 75.5GB;64K 上下文 prompt 吞吐 923.5 token/s,128K 下降到 769.8。微软给的「最佳性能」建议是 120GB 以上内存——推荐值,不是硬门槛。
基准对比里藏着两个提醒。SWE-bench Verified 云端 72.6% 对端侧量化 70.8%,1.8 个百分点的差距看着小,但代码任务对量化最敏感——自然语言错个词还能读,代码错一个 token 就是语法错误、坏 diff 或无效 tool call,放到自己仓库的 agent 流程里稳不稳定,目前没有公开独立数据。Terminal-Bench 2.1 上量化版反而更高(66.29% 对 62.9%),大概率是评测噪声或采样设置差异,别当成「量化提质」的证据。
路由层:本地模型是被分配进去的
HydraFusion(9 月研究预览,10 月扩展到 Windows 本地模型)做的不是「选一个模型」,而是给每个请求生成执行计划:按推理、代码生成、调试、工具调用四类信号打分,然后在 Single(单模型做完)、Cascade(便宜模型起草、质检不过升级)、Critique(一个起草、另一个无工具的评论者只读评审)三种模式里挑。
对照基线 Claude Opus 5 的成绩:TerminalBench 2.1 成本降 67%、质量还高 4.9 个百分点;DeepSWE 成本降 36%、质量低 1.5 个点。GitHub 社区讨论里有开发者的真实反馈——质量不比全程 Opus 5 差太多,额度消耗只有平时一成,但看不到实现阶段实际用了哪个模型,AIC 计数和 CLI 计数对不上。路由类方案最要命的就是这种信任缺口:它替你做了决定,你必须能看见。
两条防半成品的工程约束值得单独记:评论者跑在无工具上下文里,物理上不能改仓库;工作流取消或校验失败时不落任何补丁。Cascade 还有个隐藏账单——升级途中被打断,代码不落盘,已消耗的 token 照付。
治理层:MXC 把权限写进操作系统
发布会现场演示的场景足够扎心:一个恶意 GitHub 仓库诱导编码助手执行命令,开出 reverse shell。MXC(Microsoft Execution Containers)是对此的正面回答,10 月 7 日 GA(Windows 11 商业客户),定位是策略驱动的执行层。设计上最关键的一条:策略存在于 agent 工作负载之外,agent 或它生成的代码没有权限给自己加权限。
后端按隔离强度分四档:Process container 三平台可用(分别基于 AppContainer、Seatbelt、Bubblewrap);Session container 仅 Win11,用独立 Windows 账户隔离桌面、剪贴板和输入;WSL container 服务 Linux 工具链;MicroVM 硬件级强隔离但还是实验性。策略面覆盖 containment、进程、文件系统、网络、UI 五块——编码 agent 可以读写自己的仓库、调用 git,但摸不到用户 Documents,进出站网络也能整体禁掉。
三种运行模式别混用:Enforcement 越界即拦,生产唯一选项;Learning 照样拦但把被拒操作写进 JSON 报告,是补权限清单的工具;Permissive 只记录不拦截,仅限调试策略本身。建议节奏是 Learning 先跑一两周攒权限画像,再切 Enforcement——企业 IT 团队现在就该动手,别等 Intune 集中管控 GA。策略文件按「需要什么」写而不是「禁止什么」,默认拒绝永远是更安全的姿势:
{
"containment": "process",
"filesystem": {
"readwrite": ["~/work/my-repo"],
"deny": ["~/Documents", "~/.ssh"]
},
"network": { "outbound": false, "loopback": true },
"ui": { "desktop": false }
}
上手验证与真金白银
本地环境起没起来,两条命令确认:curl http://localhost:<port>/v1/models 返回模型列表才算就绪;nvidia-smi 核对显存水位——权重 53GB 不等于占用 53GB,长上下文的 KV cache 才是峰值大头,256K 满载 75.5GB 这个数要留足余量。
成本换算别只盯着「零推理费」。本地推理把云端的按次付费换成硬件投入加电费加维护,划不划算取决于任务频次和机器利用率:全天满负荷跑 agent 的重度用户,回本周期可能短得惊人;一天几条查询的普通用户,$2,599 起步的 Surface Laptop Ultra 纯属浪费。8GB 内存就能起步的 Foundry Local(ONNX Runtime 线)才是大多数人的入口。
还有个容易忽略的事实:本地推理不等于会话离线。远程工具调用、另发的云端请求,都可能把代码和数据送出这台 PC。MXC 的边界是「这台机器上 agent 能碰什么」,不是「数据最终去了哪里」。
收拢一下:这套组合真正适配的只有两类人——128GB 级机器、上下文常驻 64K 以上、对代码隐私敏感的重度 Agent 用户;以及要把「最小权限」从口头约定变成 OS 级强制的企业平台团队。其他人先从 Foundry Local 和策略草案开始。一句话总结这笔交易:省下来的是按次推理费,付出去的是前置硬件与治理成本。

评论0