在移动影像领域,如何用轻薄的手机拍出媲美专业单反的长焦虚化效果,一直是业界攻坚的难题。近日,vivo蓝图实验室携手中国科学院深圳先进技术研究院,交出了一份惊艳的答卷——MagicBokeh。该成果不仅成功入选CVPR 2026 Oral,更是入围了Best Paper Finalist(最佳论文候选)。
MagicBokeh是一套基于统一生成式框架的长焦虚化渲染方案。它针对高倍变焦下低质输入的痛点,将超分辨率重建与虚化渲染巧妙融合进单一的扩散模型中。通过交替式训练机制、对焦区感知的掩码注意力以及退化感知的深度预估,该方案有效遏制了噪声放大、边缘模糊及误差累积等顽疾。
无论是在合成数据还是真实场景测试中,MagicBokeh均展现出SOTA(当前最优)的表现,为移动端实现高效且逼真的长焦虚化仿真开辟了全新路径。
相信不少用户在使用手机长焦拍摄人像时都有过这样的体验:虽然远处的被摄主体被拉近了,但背景却缺乏那种专业相机特有的柔和散景,空间纵深感大打折扣。究其根源,物理层面的先天不足是首要原因。
受限于轻薄机身的物理空间,手机镜头模组的长度、传感器尺寸以及光圈大小都极为有限。即便是目前旗舰机普遍采用的潜望式长焦方案,在真实光学素质上依然难以望专业相机之项背。光圈不够大、传感器不够大,自然就无法营造出浅景深效果。
因此,计算摄影成为了弥补硬件短板的核心手段。
近年来,从多帧合成、AI降噪到超分算法,再到人像分割与虚化渲染,技术迭代不断拓宽了手机影像的能力边界。在常规人像模式下,我们已经能获得不错的虚化表现。然而,一旦切换到高倍数字变焦场景,情况便急转直下。高倍变焦通常依赖于数字裁切和多帧合成,画面被强行放大后,原本隐匿的噪点、纹理糊化以及边缘发虚等问题也会随之加剧。此时,输入端已经不再是高质量图像,若直接套用虚化算法,极易导致主体边缘毛糙、背景层次混乱,最终成片既不够清晰,也缺乏高级感。
CVPR 2026最佳论文候选:MagicBokeh如何重塑手机长焦虚化体验
手机长焦虚化,为何总是差强人意?
MagicBokeh的破局之道:从串联到融合
首先是
误差传递
。超分模型的输出并不总是完美的,它可能引入伪影、错误纹理或局部模糊。这些问题一旦进入虚化阶段,就可能被进一步放大,最终影响主体边缘、背景过渡和整体真实感。其次是
端侧效率
。手机影像链路对延迟、功耗和内存都极其敏感。如果先运行一个基于生成大模型的超分算法,再运行一个基于生成大模型的虚化算法,意味着两次完整的生成大模型推理和额外的数据搬移。
对于真实拍摄体验来说,这并不是理想答案。因此,MagicBokeh 重新思考了这个问题:
如果用户最终想要的是一张“高倍变焦下既清晰、又自然虚化”的照片,为什么不让模型从一开始就围绕这个最终目标来生成?三、MagicBokeh:从模块串联到统一生成
MagicBokeh 的核心思路,是用一个统一的扩散框架,实现面向长焦场景的虚化渲染。不同于传统的串联链路,在一次推理中同时完成真实世界图像超分辨率和可控虚化渲染,而且两个任务可以同时利用生成模型的先验。它并不是简单地把“超分模型”和“虚化模型”合并到一起,而是把两个原本割裂的中间步骤,重新组织为面向最终成像体验的一次生成过程。
在这个过程中,模型需要同时理解三件事:
哪些区域应该尽可能保持清晰;
哪些区域应该根据空间关系自然虚化;
如何在退化输入、有限算力和可控效果之间取得平衡。四、让模型知道:哪里该清晰,哪里该虚化
要在同一个生成过程中同时完成“清晰恢复”和“背景虚化”,并不容易。超分辨率希望尽可能恢复全图细节;虚化渲染则希望保持对焦区域清晰,同时让背景区域呈现自然、平滑、有空间层次的散景效果。二者在空间目标上天然不同。为了解决这个矛盾,MagicBokeh 设计了多项关键机制。
交替训练策略
MagicBokeh 没有强行让模型在同一时刻同时学习所有目标,而是采用交替训练策略:在不同训练阶段分别强化画质恢复能力和虚化渲染能力,让模型逐步学会在两种目标之间取得平衡。这种设计让模型既能恢复高倍变焦图像中的对焦区域细节,又能在非对焦区域生成符合空间关系的自然虚化。对焦区域感知的注意力机制
为了让模型明确理解“哪里该清晰,哪里该模糊”,MagicBokeh 引入了对焦区域感知的掩码注意力机制。它利用由深度信息生成的 defocus map,对图像中的对焦区域和非对焦区域进行区分,并在注意力计算中加入空间约束。
这样,模型在处理主体和背景时,可以采用不同的生成逻辑,减少超分和虚化之间的互相干扰。退化感知的深度估计
自然虚化离不开准确的空间理解。但高倍变焦图像通常存在噪声、模糊和细节缺失,普通深度估计模型在这种输入下容易失准。MagicBokeh 针对这一问题设计了退化感知的深度估计模块,让模型在低质量变焦图像上依然能够获得更稳定的深度先验,为后续虚化提供可靠的空间结构基础。
图 3:MagicBokeh 长焦虚化效果图
五、让生成模型真正进入手机影像链路
近年来,生成式模型在图像生成、修复、编辑和增强任务中展现出强大能力。
但要让这些模型真正进入手机拍摄链路,并不是简单地把大模型搬到端侧。真实手机影像场景有非常明确的约束:
输入图像可能是低质量的;
用户需要可控、自然、符合真实先验的输出;
推理必须足够快;
算法必须适应端侧算力和功耗预算;
最终结果必须服务真实拍摄体验。MagicBokeh 的探索意义正在于此。它不是把生成模型当作后期修图工具,而是让生成能力进入真实成像流程,参与解决手机光学系统受限带来的体验问题。通过统一框架、轻量化设计和可控虚化条件,MagicBokeh 让高倍变焦场景下的清晰恢复与自然虚化具备了更现实的落地可能。
六、效果与效率
在 EBB400-LQ 基准测试中,MagicBokeh 相比此前传统影像链路中“模块串联”的设计方案,在虚化质量、画质和推理效率上都展现出优势。MagicBokeh 能够在一次推理中完成高倍长焦虚化,避免两阶段流水线中的误差传递和重复计算。同时,MagicBokeh 支持焦点位置调节和虚化强度控制,使用户可以获得更加灵活的再对焦和景深效果。更重要的是,MagicBokeh 采用了面向端侧部署的轻量化设计。通过对扩散模型结构进行裁剪和微调,它在保持感知质量的同时显著降低了计算开销,为真实移动设备上的部署提供了可能。
七、写在最后 手机影像的发展,本质上一直是在物理限制与用户期待之间寻找新的平衡。每一次技术演进都在让手机更接近专业影像设备的拍摄体验。但越接近真实使用场景,问题也越复杂:它不再只是单点算法能力的竞争,而是整条影像链路如何围绕最终用户体验重新组织。MagicBokeh 入围 CVPR 2026 Best Paper Finalist,是对这项工作技术结果的认可,更是对其问题意识的认可。它从手机高倍变焦这一真实拍摄痛点出发,重新思考了画质恢复、空间理解和自然虚化之间的关系。
它想回答的,不只是“如何做出更好的虚化”,而是:
当手机光学硬件受到物理限制、端侧算力受到现实约束时,生成式计算摄影应该如何真正服务于用户按下快门后的最终体验?这也是 MagicBokeh 带来的启发:生成模型的价值,不只是创造新的图像,更是帮助移动设备突破物理边界,让清晰、自然、可控的成像体验真正进入日常拍摄。vivo BlueImage Lab
蓝图实验室,主要负责移动影像算法创新,包括图像/视频处理、图像/视频交互、图像/视频增强、多模态理解大模型等方面的技术前沿探索。致力于不断提升 vivo 移动影像的算法能力,使用户能够拍摄出更加清晰、美观的照片和视频。
同时积极探索增强现实、具身智能等新兴技术领域的应用,努力为用户提供更加丰富和便捷的影像体验。

评论0