网易首页 > 网易号 > 正文 申请入驻

边缘设备低光视频优化:从400毫秒降至28毫秒

0
分享至


当企业部署AI技术时,最常见的瓶颈并非模型开发本身,而是部署阶段:让训练完成的模型在实际目标设备上稳定运行。

这项CCTV低光视频修复项目遵循了同样的规律,部署阶段的优化正是核心挑战所在。客户现有模型在目标边缘环境(Jetson Orin NX)上测得每帧处理时间为400毫秒,远远达不到33毫秒(30帧每秒)的实时目标。

最终,Nota AI在满足客户质量要求的同时,将处理时间缩短到28毫秒以内(超过30帧每秒)。

这一改进并非仅靠通用的后期优化手段实现。当量化、剪枝等标准方法达到极限后,Nota AI将硬件约束与视频领域的特定特性结合起来,从零开始重新设计模型。

以下内容将详细说明标准优化方法在边缘设备上究竟卡在哪里,以及Nota AI如何通过从模型架构到硬件优化的一体化设计能力,解决了实时处理难题。

CCTV运行标准与现有视觉模型的局限

此次合作的初始规格要求总结如下。

30帧每秒并非随意设定的数字,而是下游目标检测与跟踪的下限。低于这一速率,快速移动的物体会在帧间丢失,检测将变得不可靠。

将这个案例仅视为纯粹的"速度问题"是有偏差的。由于部署领域是商业CCTV运营,图像质量与运行条件是相互交织的。除了30帧每秒和边缘部署之外,以下运行条件必须同时满足才有实际意义:

无参考图像(GT-free)环境:现场没有可用的参考图像,性能必须依靠"无参考质量"指标来验证。亮度顺序保持:防止明暗相对平衡被扭曲,否则会降低下游目标检测的准确性。自然图像质量:确保下游识别算法能够提取稳定特征,而不受人工噪点干扰。

多通道并发处理:多个摄像头通道必须在单个GPU上同时运行,以保证基础设施效率。

在这四项运行条件中,现有模型面临的第一个障碍是评估指标的差异。传统算法验证通常依赖PSNR(峰值信噪比)或SSIM(结构相似性指数),两者都是在像素级别将修复图像与参考真值(GT)图像进行比较。

然而在实际CCTV部署中,并不存在这样的参考真值。评估必须转而依靠无参考指标:NIQE(自然图像质量评估)用于衡量感知自然度,LOE(亮度顺序误差)用于衡量每帧内相对亮度顺序。一旦评估标准转变为此类运行指标,即便是在公开数据集排行榜上领先的模型,也不再能保证在实际生产环境中具备质量优势。

即使某个模型满足了这些无参考质量标准,实时处理约束(33毫秒)仍是一个完全独立的挑战。以下具体实验数据详细说明了现有基线模型究竟超出这一目标多少,并在实际硬件上造成了瓶颈。

33毫秒的壁垂:通用优化的局限所在

客户为部署准备的现有模型是一个重量级架构:一个基础低光增强模块,后接一个独立的去噪模块,用于抑制亮度提升过程中被放大的噪点。原始模型在部署目标设备(Jetson Orin NX)上运行时,推理时间达到约400毫秒,超过33毫秒实时目标的10倍以上。为了评估优化的上限,我们在规格更高的开发板(AGX Orin)上对模型进行了性能分析。即便在这块开发板上,延迟仍测得约180毫秒,仍远远达不到目标。

我们在开发环境中应用了所有可行的优化技术。首先,通过修改原始模型的ONNX图以减少Transpose和Reshape操作,并提高下采样比例,我们将延迟从180毫秒降至约60毫秒。然而,一旦将TensorRT 10.3.x确定为运行时,运行时本身开始自动执行这种手动图优化,这一路径便再无更多优化空间。INT8量化由于符合条件的层比例有限,实际运行速度反而比FP16更慢。50%剪枝将帧率压制在目标帧率的一半左右(约15帧每秒),并产生了明显的质量下降,进一步推进已无意义。

我们得出结论:仅靠对现有模型架构的后期优化,无法达到33毫秒的目标。作为替代方案,我们试验了该领域四个广受引用的模型:RUAS、Zero-DCE++、LiteIE和Wave-mamba。这些模型均未达到目标。

经过一系列实验,根本原因逐渐清晰。现有模型和这四个替代模型都依赖一种重量级的计算方式:从零开始生成或修复整张图像。在这种模式下,无论怎样优化都无法突破33毫秒的界限。因此,Nota AI停止对现成模型进行调优,转而从零开始设计一个充分考虑边缘硬件约束的轻量化模型。这一决策之所以能够实现,正是因为Nota AI将算法开发、优化和部署作为一个持续统一的流程来处理。

采用YUV通道分离的自研轻量ViT模型(98K参数)

在设计自研架构之前,我们重新定义了问题。低光视频增强的本质是恢复亮度(Y)通道,而非重新生成色度(UV)通道。在夜间CCTV环境中,大部分可识别信息是隐藏在黑暗中的亮度数据。色彩信息可以通过一个轻量级校正层来处理,而非依靠沉重的深度学习解码器,对下游识别算法的影响可以忽略不计。基于这一问题定义,我们做出了三项结构性设计决策。

YUV色彩空间分离

我们将输入图像拆分为Y(亮度)和UV(色度)通道,仅将Y通道输入模型主干网络。这将模型需要处理的输入信息量减少到三分之一,并消除了对重量级色彩重建解码器的需求。

约2/5比例的高强度下采样

由于UV通道被排除在模型主干之外,我们能够应用更大幅度的下采样。亮度通道对高频空间信息的丢失相对稳健,而色彩通道在下采样时会出现明显的色彩渗色问题。通过将色彩处理隔离到一个独立的轻量级校正层,我们使模型主干摆脱了这一限制,使1920×1080的输入以原始尺寸约2/5的比例通过主干网络。

双线性上采样与色彩校正UV合并

经下采样后恢复的Y通道,使用双线性插值上采样回原始分辨率。随后与原始UV通道合并,UV通道已经过一个轻量级色彩校正层处理,以补偿亮度变化引起的色彩偏移,从而生成最终图像。由于色彩并非通过重量级学习模型重新生成,色彩一致性能够自然保持,无需独立解码器。

在这三项机制优化后的流程中,最关键的角色由亮度(Y)恢复模块承担。部署在该位置的模型主干是DeltaViT,这是Nota AI自研的轻量级视觉Transformer(ViT),参数量约为98K。与解决同类任务的排行榜顶级模型RetinexFormer(约160万参数)相比,DeltaViT的参数量减少约16倍,直观展示了其结构上的轻量化设计。

需要说明的是:这一设计针对以亮度校正为主要需求的低光CCTV环境进行了优化。对于色温快速变化的特殊领域,如舞台照明或工业特定光谱照明中UV分量变化显著的场景,可能需要额外验证。

在Jetson Orin NX上达到28毫秒并取得顶级质量指标

将最终的Torch模型导出为ONNX并转换为TensorRT后,我们在开发环境(AGX Orin)上测得延迟低于10毫秒。转移到实际部署目标设备(Jetson Orin NX)上,结果为GPU计算时间低于28毫秒。33毫秒的量化目标以超过5毫秒的余量顺利达成。在客户现有模型此前运行约400毫秒的同一设备上,DeltaViT现在的运行时间低于28毫秒。

在解决了实时推理速度这一主要挑战后,我们进行了量化图像质量验证。该模型已经通过了客户针对运行需求的定性视觉审查。下一步是量化其与现有通用模型之间的差距。

我们在RTX 3090 24GB显卡上,针对五个标准低光数据集进行了基准测试,将自研DeltaViT(98K参数)与LYT-Net(45K)、RUAS(3.4K)、Zero-DCE++(10.6K)和RetinexFormer(160万)进行比较。值得注意的是,LYT-Net在1080p推理时因内存溢出(OOM)错误而失败,导致其在实际场景中无法运行。排除该模型后,下表总结了剩余四个模型在与CCTV生产环境最相关的指标上的表现:LOE、NIQE和1080p推理时间。

如图表所示,DeltaViT在NIQE和LOE两项指标上均排名第一。这一结果是在参数量缩小16倍(98K对比160万)、速度比RetinexFormer快约63倍的架构上实现的。在1080p推理下,DeltaViT测得8.92毫秒,约相当于112帧每秒,相对30帧每秒最低门槛有3.7倍的余量。最值得关注的是,当输入像素从480p增加到1080p,增幅达6.7倍时,DeltaViT的推理时间仅增长1.93倍,展现出卓越的负载适应能力(Zero-DCE++为6.72倍,RetinexFormer为7.87倍)。

3通道对0通道:单张RTX 3090上的吞吐量差距

此次合作的主要部署目标是在Jetson Orin NX上运行单一通道。然而,客户的运行需求还包括在中央监控服务器上同时处理多个摄像头通道的场景。单个GPU能够支撑的通道数量直接关系到部署与运营成本。

我们测量了同样的四个模型中每一个在单张RTX 3090 24GB显卡上、维持1080p 30帧每秒条件下能够同时处理的通道数量。结果显示:DeltaViT稳定支撑3个通道,Zero-DCE++在临界点达到1个通道,RUAS则不稳定,通道数低于1个,RetinexFormer的通道数为0。即便在RTX 3090这样的高端GPU上,RetinexFormer也无法维持单个1080p 30帧每秒的通道。

DeltaViT专为单通道边缘部署而设计,但同一模型却能以更少的GPU数量承担相同的多通道服务器工作负载。

从模型设计到优化的一体化流程

在Jetson Orin NX上将低光视频增强模型压缩进33毫秒约束范围内,同时满足客户的质量要求,这一目标仅凭通用的后期优化手段是无法实现的。当量化、剪枝等标准压缩技术在现有修复模型固有的计算开销面前碰壁时,Nota AI选择的解决方案是一种一体化设计方法:从设计阶段起就将硬件约束与领域特性结合起来。

通过分离YUV通道将信息量减少到三分之一,并仅对亮度(Y)通道应用轻量级ViT模型的同时保留色彩关系,这种结构性方法带来的不仅是处理时间的缩短,更是在边缘设备计算约束范围内达成了目标线。最终结果:在目标设备上延迟低于28毫秒,同时在标准基准测试环境中取得LOE和NIQE指标的第一名。

这一案例为边缘部署领域提供了一个重要启示:基准分数并不能直接转化为生产环境中的实时性能。在通用图优化或压缩手段单独无法达成目标的领域,决定成败的关键在于能否将算法建模与硬件感知优化视为一个持续统一的流程,而非彼此割裂的环节。在此次合作中,Nota AI在一个真实生产目标上验证了这种一体化设计能力。

这些差异化的技术能力建立在Nota AI自研的AI优化平台NetsPresso(R)之上。

Q&A

Q1:这次低光视频优化项目的核心成果是什么?

A:Nota AI将CCTV低光视频修复模型在Jetson Orin NX设备上的处理时间从400毫秒降低到28毫秒以内,成功超过了30帧每秒的实时处理目标,同时满足了客户的图像质量要求。

Q2:为什么通用的模型优化方法无法达到实时处理目标?

A:因为现有模型依赖从零生成或修复整张图像的重量级计算方式,无论应用量化、剪枝还是图优化等通用手段,都无法突破33毫秒的性能瓶颈,因此Nota AI改为从零设计轻量化专用模型。

Q3:DeltaViT模型是如何实现轻量化的?

A:DeltaViT通过将图像拆分为YUV通道,仅对亮度(Y)通道使用轻量级Transformer处理,色度(UV)通道则用简单校正层处理,大幅减少了计算量,参数量仅98K,比同类顶级模型少16倍。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
错怪郭士强,中国男篮输日本,揪出第一混子球员,必须要淘汰

错怪郭士强,中国男篮输日本,揪出第一混子球员,必须要淘汰

宗介说体育
2026-09-19 10:15:11
安吉丽娜·朱莉自曝:不想再推人消费,我要离开洛杉矶了

安吉丽娜·朱莉自曝:不想再推人消费,我要离开洛杉矶了

自愈小日子
2026-09-18 19:43:06
1986年,中央军委决定公开邓稼先的身份,亲友疯狂拨通许鹿希电话:他还活着吗?

1986年,中央军委决定公开邓稼先的身份,亲友疯狂拨通许鹿希电话:他还活着吗?

纪史行者
2026-09-07 05:50:07
第20届亚运会开幕,中国代表团入场

第20届亚运会开幕,中国代表团入场

观察者网
2026-09-19 19:04:30
“在轨武器”刚曝光,美军高官又公开表示“做好赢得地月作战的准备”

“在轨武器”刚曝光,美军高官又公开表示“做好赢得地月作战的准备”

澎湃新闻
2026-09-18 17:44:03
中央领导悼念仅1天,央视对敬一丹称呼变了,2字之差释放强烈信号

中央领导悼念仅1天,央视对敬一丹称呼变了,2字之差释放强烈信号

史之韵
2026-09-19 01:09:03
被0-7打服?德甲队官方喊话:19岁亚马尔闭嘴!拜仁2人才配拿金球奖

被0-7打服?德甲队官方喊话:19岁亚马尔闭嘴!拜仁2人才配拿金球奖

我爱英超
2026-09-19 07:01:35
外媒:沙特罕见向以色列提出支援请求

外媒:沙特罕见向以色列提出支援请求

参考消息
2026-09-19 19:11:58
真的来了!特斯拉开启新车预订,国内为 33.2 万!

真的来了!特斯拉开启新车预订,国内为 33.2 万!

XCiOS俱乐部
2026-09-19 19:31:50
又不胜,2-3,热刺遭英超倒数第二掀翻,新赛季开局连续5轮不胜

又不胜,2-3,热刺遭英超倒数第二掀翻,新赛季开局连续5轮不胜

侧身凌空斩
2026-09-19 21:34:09
赛力斯一夜变东风小康?百万粉丝问界车主发文自嘲

赛力斯一夜变东风小康?百万粉丝问界车主发文自嘲

PChome电脑之家
2026-09-19 18:18:38
彻底炸锅!黄秋生陈冠希时隔 21 年合体拍片,片方顶风操作遭全网抵制

彻底炸锅!黄秋生陈冠希时隔 21 年合体拍片,片方顶风操作遭全网抵制

内地那鱼线场
2026-09-19 19:48:04
高市改组内阁大换血!转头向我国喊话,中日关系要变天?

高市改组内阁大换血!转头向我国喊话,中日关系要变天?

共工之锚
2026-09-19 00:14:00
云南楚雄7岁哥哥和2岁妹妹被胡蜂蜇亡,伤口数分别达300和700余处,父亲:有人指责我们“生而不养”,后悔外出务工,大不了就穷一点

云南楚雄7岁哥哥和2岁妹妹被胡蜂蜇亡,伤口数分别达300和700余处,父亲:有人指责我们“生而不养”,后悔外出务工,大不了就穷一点

大风新闻
2026-09-19 17:15:06
齐达内点兵!法国公布23人名单:5大新人+11将被弃 26岁法甲金靴圆梦

齐达内点兵!法国公布23人名单:5大新人+11将被弃 26岁法甲金靴圆梦

我爱英超
2026-09-19 06:26:31
博士答辩被拒回村行医30年!62岁老村医火了,回应:尽量别打扰他

博士答辩被拒回村行医30年!62岁老村医火了,回应:尽量别打扰他

华庭讲美食
2026-09-19 08:11:50
朱德在中南海养兰花被毛泽东批评,忍痛将全部兰花送人!

朱德在中南海养兰花被毛泽东批评,忍痛将全部兰花送人!

品点历史
2026-09-18 08:48:00
一年三款车,想想就怕。

一年三款车,想想就怕。

深读时刻
2026-09-19 05:14:10
美国太强大了!核电今年集中爆发,要像造车一样成为流水线

美国太强大了!核电今年集中爆发,要像造车一样成为流水线

爆角追踪
2026-09-19 16:30:02
手搓动画《牛来》票房6300万 母子二人基本财富自由

手搓动画《牛来》票房6300万 母子二人基本财富自由

3DM游戏
2026-09-17 12:00:04
2026-09-19 21:44:49
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21974文章数 49731关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

自毁前途5年赵薇露面!家境被扒出

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

教育
游戏
旅游
手机
公开课

教育要闻

华东师范大学出版社人工智能通识课程走进江阴课堂

PS6最大的危机不是性能,而是索尼正在失去玩家

旅游要闻

不负雪域不负民,一段长征往事,读懂迪庆千年同心底色!

手机要闻

ColorOS 17硬刚OriginOS 7:谁才是2026年机圈真正的系统卷王?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版