【导读】视频正在成为AI时代最重要的数据入口。据统计,超过80%的AI模型训练和推理数据来源于视频,视频不仅是连接物理世界与数字世界的重要媒介,也成为智能汽车、机器人、安防、XR等应用获取环境信息的核心载体。
由于视频分辨率从4K到8K和10K,视频分辨率在不断提升,使得海量数据需要压缩。此时,专用于视频编解码处理的VPU已成为各类视频应用的核心引擎。
VPU也是安谋科技这家公司“All in AI”的重要一环。在今年WAIC上,安谋科技首度揭秘新一代'玲珑'VPU产品——'武当',并分享AI端到端视频编码技术。安谋科技VPU研发总监黄鑫向EEWorld详细介绍了这款产品的细节。

AI正在打开视频压缩的新维度
黄鑫表示,随着AI技术快速发展,视频正在经历从“服务人类观看”到“服务机器理解”的转变,视频压缩技术也迎来了新的发展方向。
过去,传统视频主要解决手机存储、社交分享和网络传输等问题,核心目标是满足人眼的主观视觉体验。但随着AI与视频深度融合,视频正在成为AI系统感知和理解现实世界的重要数据来源。从人形机器人、机器狗,到自动驾驶和各类视觉感知设备,大量AI应用都需要通过视频数据完成训练和推理。在这一过程中,视频不再只是内容的载体,而成为AI的“输入数据”。
黄鑫认为,视频作为连接物理世界和虚拟世界的桥梁,其数据质量直接影响AI模型的训练效果和推理精度。如果视频压缩过程中产生过多信息损失,将影响整个AI系统的性能。因此,未来VPU的设计理念也需要发生改变,从过去服务人眼视觉,转向服务机器视觉,AI正在打开视频压缩的新维度。
基于这一趋势,玲珑VPU正在推动视频编码技术演进。传统视频编码主要依赖CPU进行控制,VPU根据指令完成编码任务。而新一代VPU则开始融合轻量级AI算子,通过内容感知能力实现更加智能的视频压缩。
“武当”有什么不一样
今年3月,安谋科技正式发布首款AI VPU产品“峨眉”,并首次透露下一代产品代号“武当”。在本届WAIC上,安谋科技进一步揭开了“武当”VPU的技术细节,展示了其面向AI视频应用的新一代视频压缩能力。
作为新一代产品,'武当'全面继承了上一代CAE(Content Adaptive Encoding,内容自适应编码)技术优势,在保持行业领先编码画质的基础上,PPA(性能、功耗、面积)综合指标较上一代提升超过40%,同时进一步完善编码器规格,能够覆盖更加丰富的视频应用场景,为智能终端和边缘AI提供更高效的视频处理能力。
黄鑫解析,CAE位于视频编码流程前端,在数据搬运过程中同步完成图像处理和语义解析,并将分析结果传递给后续编码模块。通过这种方式,VPU能够根据不同视频场景进行动态优化,例如航拍、游戏、监控等场景均可以获得不同程度的码率节省。

除此之外,在“峨眉”的基础上,下一代“武当”VPU进一步进行了全面升级。
第一,在性能和能效方面,“武当”支持8K 30fps视频编码,能够满足更多AI应用场景需求,同时芯片面积相比上一代降低约40%。
第二,在视频格式支持方面,“武当”进一步扩展了编码能力,支持YUV422专业视频格式,并支持Raw Data压缩,可以减少数据转换环节,更好服务AI训练和专业视觉应用。同时,其支持最高1Gbps码率,可满足人形机器人等Physical AI应用对于高质量视觉数据的需求。
第三,“武当”继续继承“峨眉”的智能感知编码能力,在编码质量方面进一步提升,并支持灵活配置不同编码档位。目前,其最高配置已经能够达到软件编码的水平。在面向AI应用的非规则运动场景中,相比传统方案还可以实现额外5%至10%的编码质量提升。

全新的AI VPU端到端训练框架
黄鑫表示,玲珑VPU的技术路线并不会止步于内容感知编码,而是正在向端到端AI视频编码方向演进。
未来的视频编码技术将围绕两个方向持续发展:一个方向是从当前基于CAE的局部优化,进一步拓展到端到端全局优化;另一个方向是从过去主要针对人眼视觉体验的编码目标,扩展到针对不同AI任务的专项优化。

目前,玲珑VPU正在探索基于AI训练的视频编码框架。在训练阶段,通过引入前处理网络、VPU虚拟编码器、具体AI任务模型,通过联合训练和反向传播优化编码策略,使压缩效果与AI任务精度达到最佳平衡。
在部署阶段,前置网络将进一步优化,并与玲珑VPU编码器进行深度融合,使AI VPU成为真正具备任务感知能力的视频编码器。
这一思路带来了显著的实际收益。测试结果显示,在目标追踪任务(Ostrack/ViT-Base)中,AI编码方案能够实现18.3%的码率节省;在动作识别任务(SlowFast)中,可实现12.0%的码率节省。这意味着,在保证AI识别精度基本不变的前提下,系统能够进一步降低视频传输带宽和存储成本,为边缘AI部署带来更高的效率。

黄鑫表示,未来玲珑VPU不仅希望优化传统视频观看体验,更希望针对不同AI应用实现数据压缩和任务精度的双向优化。通过引入多模态参数配置、前后端AI网络,玲珑VPU希望实现“人眼看得清”和“AI看得懂”的统一。
“如果说未来AI需要拥有类似人类的视觉能力,那么视频就是连接AI与真实世界的重要窗口。玲珑VPU希望成为AI视觉引擎,让人类看清世界,也让AI真正理解世界。”黄鑫表示。

从“峨眉”到“武当”,安谋科技的目标更远了
回顾过去,“玲珑”已推出六款产品:2021年的V5/V7主要增加了AVS 2.0的Decoder,H.264、H.265的编码质量提高了15%;2022年 “玲珑”V6/V8增加了AV1的Decoder,H.264的编码质量相比V5/V7提高了10%;2024年 “玲珑”V510/V710增加了H.266的编码器和解码器;2025年 “玲珑”V520LE是专门为监控打造的编解码一体产品;2026年3月推出代号为“峨眉”的V560/V760,成为面向AI应用的新一代视频处理器IP。
回顾“玲珑”VPU的发展,每一次迭代都围绕三个核心目标展开:让编码标准更先进、让编码质量更优秀、让单核性能更高效。“武当”V620/V820作为第七款产品,同样也在围绕这三个目标展开工作。
从更长远来看,'玲珑'VPU的发展目标已经不再局限于传统视频编码器。基于全新的AI训练框架,安谋科技正在推动AI端到端视频编码技术持续演进。



