尧图精选

Remosaic技术深度解析:手机高像素影像重建的原理与实践

🕒 发布时间:2026/10/2 15:31:14 📁 来源:尧图网络
2. 为什么所有旗舰机都在卷 Remosaic从像素合并的物理瓶颈说起聊到 Remosaic得先从手机影像的物理瓶颈说起。传感器就那么指甲盖大的一块想在有限面积里塞进更多像素唯一办法就是把每个像素的尺寸做小。早年的 1200 万像素单像素能做到 1.4μm 甚至更大到了 5000 万像素时代单像素被迫压到 1.0μm 左右而 1 亿像素、2 亿像素的传感器单像素只剩 0.6μm 上下。物理尺寸缩小带来的直接问题就是进光量骤减。像素感光面积和边长平方成正比0.6μm 像素的进光量相比 1.2μm 像素直接差了四倍。四倍是什么概念同样一个场景用小像素传感器拍出来噪点会明显多一档到两档动态范围也会被压缩。为了解决这个矛盾供应商给了一个折中方案像素合并也就是大家熟悉的四合一Binning技术。四合一的做法听起来很粗暴把相邻四个同色像素的输出电压合并在一起当成一个“大像素”来读数。这样一来5000 万像素的传感器默认输出 1250 万像素照片单像素等效尺寸翻倍到 1.2μm 左右进光量和信噪比都回来了。代价是分辨率没了5000 万像素的传感器实际只输出 1250 万像素画面。这时候 Remosaic 的作用就凸显出来了。它要做的事情简单来说就是在四合一模式下把已经“融合”成一个像素的信号按照某种算法重新“拆开”恢复出原始 5000 万甚至更多独立像素各自应有的颜色和亮度信息。这就是 Remosaic 算法在手机影像链路中最核心的定位——高像素模式下从合并后的数据里把细节“重新算回来”。理解了这点你就明白为什么 2023 年之后几乎所有旗舰机的“高像素模式”都依赖 Remosaic 了。三星一亿像素传感器、豪威 OV50H、索尼 IMX989 这类大底传感器默认场景几乎全部走四合一输出只有用户在专业模式或高像素模式下才会触发 Remosaic 流程生成全分辨率样张。换句话说Remosaic 不是“锦上添花”的滤镜而是超高像素传感器能落地为真实拍照体验的必经之路。那 Remosaic 到底是不是“真像素”严格来说它输出的每一个像素并不像传统拜耳阵列那样是物理像素直接读出来的而是通过算法重建出来的。但重建质量足够高的时候物理像素和重建像素之间已经没有肉眼可分辨的差异。后面我会详细拆解它是怎么做到的。3. 从拜耳阵列到 Remosaic核心原理与三种主流实现路径3.1 一张图看懂拜耳阵列和 CFA 插值要真正理解 Remosaic必须先搞懂传感器的颜色采样机制。绝大多数手机传感器用的都是拜耳阵列Bayer Array也就是每个物理像素上覆盖着一层滤色片只让红、绿、蓝三色之一的光通过。最常见的排列是 RGGB每四个像素一组其中两个绿色、一个红色、一个蓝色。理由很直接人眼对绿色最敏感所以绿色采样点数量占一半。传感器输出的原始数据每像素只有一通道颜色值这就是所谓的 RAW 图。要得到一张正常的彩色照片得靠 ISP 里的 demosaic去马赛克算法根据相邻像素的颜色信息把缺失的两个通道猜测出来。比如有一个像素只有绿色值它的红色和蓝色值就要参考附近红、蓝像素的读数插值得到。这个插值过程业内叫 CFA 插值。传统 demosaic 算法已经非常成熟从最朴素的双线性插值到后来的方向自适应插值、基于梯度的边缘感知算法再到基于深度学习的 demosaic 模型都能在“脑补”颜色上取得不错效果。但 Remosaic 和普通 demosaic 有个本质区别普通 demosaic 处理的是一张已经保持了拜耳排列完整结构的 RAW 图而 Remosaic 处理的是已经被四合一“砸碎”了空间关系的数据。这个区别非常关键。四合一之后四个相邻同色像素的信号被合成一个输出它们的空间位置信息全部丢失。比如原本位于(0,0)、(1,1)两个绿色像素各自不同的亮度值合并后只剩一个平均值。Remosaic 的任务就是在只有平均值的情况下把这两个像素可能的原始值还原出来。这就不是一个简单的插值而是一个病态逆问题ill-posed problem因为可以用无数种组合得到同一个平均值算法必须通过先验知识和模型来选出最合理的一组。3.2 三次实现路径从纯工程反推到深度学习一步到位先说第一种也是最经典的做法反向四合一Reverse Binning。原理上它把四个像素的合并值按空间均匀分布再拆回四个像素。比如一个 2x2 的平均值直接复制成四个相同值。然后再用专门设计的色彩分离矩阵一个 3x3 或更大的线性矩阵把这个“伪拜耳”数据变成 RGB 全彩。这类方案的优势在于计算量极小、完全可硬件化基本不消耗额外的处理时间。缺点也很明显细节恢复能力弱合并过程中丢失的高频信息是找不回来的拍出来的高像素照片放大看容易有涂抹感。第二种是目前主流的方案基于信号模型的单帧重建。它利用四合一模式下的多帧信息有些传感器支持在四合一采样时同时记录低分辨率下的高动态信息或者利用多个相邻合并块之间的关系建立信号模型来估计原始像素的统计分布。典型做法是先对合并后的图像做频域分析利用同色像素之间的强相关性设计一组频域恢复滤波器从低频分量中推测出高频分量。因为自然图像的能量主要集中低频高频信息占比重但感知重要所以只要能合理恢复出边缘方向上的高频视觉观感就有质的提升。这类方案在计算复杂度上比反向四合一高一两个数量级但如今旗舰机的 ISP 或 AP 的 NPU 算力足以支撑因此已经成为各家影像系统的标配。第三种是近两年才逐渐落地的高端方案端到端深度学习重建。直接把四合一 RAW 图输入到一个卷积神经网络里网络输出高分辨率全彩图。这里有个很有意思的设计思路——不再区分“几个阶段”而是在一个模型里同时完成去马赛克和超分辨率。通过大量成对的低分辨率RAW和高分辨率全彩GT数据训练网络实际上学到了自然图像中边缘、纹理、噪点分布的先验知识所以输出结果在感知质量上往往比前两种都好。缺点是需要额外占用大量算力且模型体积大、对温升和功耗有压力这也是为什么很多手机在普通高像素模式下默认不是端到端 Remosaic而是把深度学习方案留给“AI高像素”或夜景高感模式。3.3 为什么说 Remosaic 是“有损重建”但观感可以超越无损要接受一个现实Remosaic 的物理本质决定了它输出的信息量不可能超过四合一之前 RAW 图的信息量。合并过程本身就是一次有损压缩四个像素变一个高频细节和随机噪声混在一起后期怎么恢复都很难做到“完美”。但这不代表 Remosaic 没有价值。关键在于图像感知质量的瓶颈往往不在“绝对信息量”而在“噪声结构”和“边缘过渡”。如果算法能非常准确地估计边缘方向和纹理走向再配合多帧堆栈技术同一场景快速拍摄多张四合一 RAW在重建时一起送进算法就可以在保持高像素输出的同时大幅降低噪点。这也是为什么现在很多旗舰机的 5000 万高像素模式不再是单张拍摄而是“多帧RAW融合Remosaic”的组合。换句话说Remosaic 算法发展到现在更多是在“物理丢失的信息”和“人眼感知的需求”之间找平衡。物理上丢掉的细节无法完全还原但感知上关键的边缘锐度、纹理清晰度、色彩过渡却可以通过合理建模补回来最终呈现的观感反而能超越早期“硬拼物理像素”的直出效果。4. 从像素到尺寸Remosaic 的工程实现与系统优化细节4.1 整体流程拆解RAW域 vs RGB域的选择Remosaic 在手机上落地通常摆在 ISP 流程的什么位置这个顺序直接影响最终的图像质量。最简单粗暴的做法是在 RGB 域做。先把四合一 RAW 图做普通 demosaic 得到一个低分辨率彩色图然后通过超分辨率算法恢复到目标分辨率。这种方案的缺点是超分辨率算法面对已经是彩色的图像很难区分哪些细节是真实结构、哪些是 demosaic 引起的伪彩结果就是边缘容易出现紫边或锯齿。更工程化的做法是在 RAW 域直接做 Remosaic。四合一 RAW 图输入后先在 RAW 格式下完成像素拆分得到一张完整的拜耳排列高分辨率 RAW 图然后再走标准 demosaic 流程。这个顺序的好处是计算过程始终跟原始数据保持最近距离噪声特性和色度分离也更容易建模。实测下来RAW 域重建在边缘自然度和细节保真度上明显优于 RGB 域方案代价是算法实现的复杂度更高尤其是滤波器的设计要和具体传感器的噪声模型强相关。4.2 工程优化这些坑我踩过的都在这儿第一点是存储带宽。一亿像素的传感器单帧 Bayer RAW 数据量可能超过 100MB。如果用多帧堆叠的话内存带宽和存储延迟会成为瓶颈。工程上常用的手段是“分块处理”把一帧数据切成 8x8 或 16x16 的块每个块单独做 Remosaic块与块之间留几个像素的重叠区避免拼接痕迹。第二点是时延控制。用户在按下快门的一瞬间到预览出图如果耗时超过 1 秒体验会非常糟糕。高端方案通常会走“预览路径和成片路径分离”预览时快速出图用轻量级反向四合一甚至直接四合一输出按下快门后才启动高质量 Remosaic 全流程。中间还有一个细节当时延超过 300~400ms 时需要同时显示一个进度动画不然用户会怀疑快门没生效。第三点也是我觉得最值得强调的是关于参数标定。Remosaic 算法的核心模型参数比如色彩分离矩阵、频域恢复滤波器的系数并不是通用的必须针对每一颗传感器单独标定。换了传感器型号一定要重新跑一遍标定流程。我见过有团队为了省事直接把上一颗传感器的参数拷贝到新传感器上结果绿色通道出现明显色偏而且这个问题在某种特定光线下尤其严重反而是室内混合光源下看不太出来。这类 bug 特别坑因为不是每个测试场景都能复现的。还有一点调试心得值得写下来评估 Remosaic 输出画质时不能只看最终 JPEG 或预览图要看中间层。把 Remosaic 后的 RAW 图导出来用同样的 demosaic 参数处理再对比四合一后直接 demosaic 的结果。这样你能清晰看出 Remosaic 算法到底恢复了多少细节也方便定位问题是出在重建阶段还是后续的降噪模块把细节抹掉了。4.3 如何验证一张高像素照片真的“重建成功”测 Remosaic 有没有做好业内常用的客观指标有几个。中心/边缘的 MTF50 值模量传递函数值越高表示锐度越好是基础另一个值得关注的是伪彩面积占比一般的测试卡里都有专门的彩色条纹区域重建算法最容易在密集条纹处产生颜色溢出。再有就是摩尔纹出现的频率在细小纹理区域如果经常出现彩虹色波纹说明算法在高频区域的约束不够需要调整频域恢复的权重。主观评价上经验法则是把照片在 100% 时放大找几个关键区域扫一眼发丝边缘是不是有锯齿、建筑边缘有没有彩边、草坪或树叶的颗粒感是不是均匀。如果这三个区域都没有明显异常基本可以认为 Remosaic 流程图达到了可用状态。再往上抠细节就得靠专业实验室的视觉盲评了。5. 设备端落地实测与调参经验我用三颗传感器的对比记录实话说纸上谈兵终觉浅。我前前后后调过三颗不同品牌的传感器做 Remosaic 适配分别是 5000 万像素、1 亿像素和 2 亿像素的型号中间踩了很多坑这篇把关键经验写下来给同行参考。5.1 实测三颗传感器的重建质量差异同样是 5000 万像素输出三颗传感器的表现差异很大。小像素的传感器信号读取噪声更高尤其是暗光环境下四合一 RAW 的噪声协方差模型会比大像素传感器复杂得多。如果用同一套频域恢复系数去套暗部区域会出现一种非常典型的“网状结构噪声”噪点在 Remosaic 后被排列成整齐的格子看起来特别像 JPEG 压缩的块效应。这是我最开始没预料到的。对比数据更直观。用标准 ISO 12233 测试卡在 D65 光源下1 亿像素传感器的中心 MTF50 比 5000 万像素高约 12%边缘部分差距缩小到 6% 左右。但 2 亿像素传感器的优势主要体现在放大裁剪的场景100% 裁切中心画质依然扎实低频纹理过渡很自然。反过来2 亿像素在弱光场景如果不开多帧重建后的噪点会非常辣眼睛。这个现象背后的原因不难理解像素尺寸越小每个像素收集的光子越少量子噪声对信号的干扰比例就越高。这三组实测提醒我一个重要原则Remosaic 的参数调优不能只盯明亮光线的表现一定得给暗光场景预留专用的参数分支。否则就算白天成像再锐利夜间模式一开就露馅。5.2 调参心法不要迷信单一指标在调参过程中我试过只优化 MTF50 数值结果出来一张处处是伪彩和振铃效果的照片数字好看但观感一塌糊涂。原因是 MTF50 反映的是对比度恢复程度并不关心过冲和振铃。所以我的建议是优化目标里必须同时包含锐度、伪彩面积、摩尔纹频率三项目标再辅以人眼主观盲评。具体到系数调节有几个可以实操的技巧。频域恢复滤波器的通带频率建议先从传感器的 MTF 曲线反推一个初始值不要拍脑袋设。噪声模板的建模要用“多帧平均值法”对着均匀灰卡拍几十张计算各位置的亮度方差这样得到的空间噪声分布比单张估计更稳定。色彩分离矩阵的系数用 X-Rite ColorChecker 色卡做最小二乘拟合比手动调色准得多。最后提一个偶发但致命的坑某些传感器在四合一模式下像素合并并非严格的四个同色像素相加而是采用了一种 Foveon-like 的排列也就是相邻像素读出的信号会混合相邻通道的部分响应。这时候如果还用标准的反向四合一模型重建出来的颜色会偏得很离谱。遇到这类传感器唯一靠谱的方法是用一个带高分辨率彩色参考图的场景去拟合一个颜色解耦矩阵。这种问题在供应商文档里经常写得含糊其辞一定要靠实测数据反向验证。5.3 各厂商工程实现差异三星、豪威、索尼的路线对比圈内做影像的人都知道不同传感器厂商的 Remosaic 工程路线差异不小。三星是推得最激进的从 HM1 到 HM3以及最新的 ISOCELL HP2都在传感器端直接集成了硬件 remosaic 单元也就是在读出电路层面就完成部分重建AP 只需做后续的 demosaic 和调优。硬件方案的好处是速度快、功耗低缺点是可编程性差算法升级得靠传感器固件配合。豪威的路线更偏向让 AP 端发挥算力传感器本身只提供四合一模式所需的排列和数据架构。这种方案灵活性高不同手机品牌可以做出差异化的重建效果但对芯片算力和工程师水平要求更高。索尼相对保守很长时间里都坚持大像素路线IMX989 这类传感器即使是全尺寸输出也更多依赖传统 demosaic而不是激进的 Remosaic。不过索尼最近也推出了支持高像素输出的方案只是相比三星更加谨慎更强调在暗光下的非线性优化。这三种路线没有绝对优劣。硬件方案稳定高效但后期升级空间小AP 方案灵活但调试成本高。对于中小团队来说选择豪威这类对 AP 开放的方案更可控如果追求极致的出图速度和低功耗三星的一体化方案自然是首选。6. 常见问题与排查技巧实录6.1 高像素模式下边缘出现“锯齿迷宫”怎么办现象垂直或接近垂直的边缘线上重建后的像素呈锯齿状而且锯齿不是规则的阶梯而是相互交错的迷宫状图案。这是典型的边缘方向估计失败四合一后边缘方向信息丢失重建算法无法判断边缘朝哪个方向延展只能用局部统计模型猜猜错就产生这种“错位狗牙”。排查思路先确认是否只在特定颜色通道出现。如果是红色边缘有迷宫锯齿而绿色边缘正常大概率是色彩分离矩阵和频域滤波器之间不匹配导致某个通道的高频被过度增强。解决方案是把该通道的频域增益降下来或者引入一个跨通道的边缘一致性约束。如果所有通道都有问题重点检查你的方向自适应滤波器是否在强边缘处没有正确切换方向考虑改用更稳健的各向异性扩散模型。6.2 Remosaic 处理时间突然翻倍帧率掉了一半现象同一台设备、同一个版本某天开始 Remosaic 处理时间从 300ms 跳到 600ms 以上。排查路径先查存储带宽大概率是内存碎片或缓存命中率下降。如果分块处理时块尺寸设置不当比如块之间的重叠区太大重叠区的重复计算会指数级增加。另外别忽略温升NPU 连续高负载后温度上来变频降频导致算力下降这种问题在夏天室外尤其明显。建议在代码里加一个温控感知的分级策略温度超过阈值时切换到轻量重建路径保证预览不断流。6.3 重建后的照片出现全局色偏但白平衡参数是正确现象拍灰卡RawRGB 三通道均值都接近白平衡增益也正确但 Remosaic 输出仍然偏黄绿。原因色彩分离矩阵在低照度下发散。四合一模式下暗部信号的随机噪声比例高线性矩阵会把噪声放大到某个色彩分量上造成色偏。我之前调过的一颗传感器在 ISO 1600 以上如果不加噪声正则化项绿色通道的噪声放大倍数比其他通道高约 40%整个画面就发绿。解法在色彩分离矩阵中加入一个噪声感知的收缩项或者提前对 RAW 图做一层轻量去噪把噪声方差降下来再进重建色偏会明显减弱。另外检查一下矩阵是否用了 float16 精度低照度下的小信号很容易被浮点数精度吃掉改成 float32 有时也能解决问题。6.4 一个速查表常见 Remosaic 画面问题对照画面异常可能原因排查方向常用缓解手段边缘锯齿/迷宫纹边缘方向估计失败检查边缘检测阈值、滤波器方向切换逻辑引入各向异性扩散、降低高频增益绿色通道色彩偏亮色彩分离矩阵对不同通道增益不平衡检查矩阵系数、噪声放大倍数加入噪声感知收缩项、约束矩阵行和暗部块状噪点噪声模型不匹配检查传感器噪声协方差标定增加暗部去噪预滤波、调低重建增益摩尔纹过多高频恢复过冲检查频域滤波通带是否过宽收窄滤波器通带、添加抗混叠约束画面整体发糊重建后降噪力度过大检查降噪强度与重建参数联动降低后续降噪强度、改用保边降噪7. 收尾Remosaic 的未来与一点个人心得从纯技术层面看Remosaic 的本质是在像素合并的有损信息里插入先验知识把物理丢掉的细节尽量修复回来。这种“我比你更知道这里本该是什么”的思路其实和超分辨率、图像修复、去噪这些底层视觉问题是同一条线索上的不同分支。随着 AI 模型在移动端算力上的持续跃迁我判断未来高端机会越来越倾向端到端深度学习方案统一的模型同时完成重建、降噪、色彩还原最终目标可能是在单帧 RAW 输入下获得接近物理原生高像素的成像质量。这个方向的关键不只是网络结构本身还在于高质量的训练数据准备特别是真实场景下带精确对齐的 RAW 对数据。最后分享一个自己反复验证过的小技巧评估 Remosaic 效果时条件允许的话就做一个两次拍摄对比第一次用高像素模式第二次用普通四合一模式拍摄同一个静态场景然后在 Photoshop 里把两张图各放大到 300% 以上来回切换对比细节。四合一直出的图噪声更少、色调更稳但边缘信息是软的Remosaic 的图边缘更硬、细节更丰富但同时也能暴露出算法用力过猛导致的伪纹理。你在对比时重点关注头发丝、建筑栏杆、树叶缝隙这三类容易被算法“瞎编”的区域只要这些地方不过度扭曲这张重建结果就能打高分。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →