新闻中心

破解“云边”的智能难题,关键在这张“网”!

发布时间:2025-09-12 09:30:58  /  浏览次数:320 次

【导语】视联网作为新型基础设施,正以高清视频与多模态智能交互推动产业数字化升级。2025年,随着生成式AI爆发,大小模型协同成为视联网核心技术演进方向——大模型提供全局感知与决策能力,小模型专注边缘端实时处理,二者通过“云边端”架构互补共生。这一技术变革既面临算力分配、数据隐私等挑战,也孕育着多模态融合、端边云脑协同的产业生态新机遇。

破解“云边”的智能难题,关键在这张“网”!

视(shì)联(lián)网(wǎng)作(zuò)为(wèi)新(xīn)型(xíng)基(jī)础(chǔ)设(shè)施(shī),通(tōng)过(guò)进(jìn)一步构建全链路高清视频和多模态智能交互结合,推动产业数字化高质量发展。2025年,随着生成式AI与大模型的爆发式发展,作为视联网重要技术体系之一的大小模型协同加速演进。大模型提供全局感知、多模态理解与决策推理能力,小模型聚焦边缘端低延迟、高可靠的实时处理需求,二者通过“云边端”分层架构形成互补共生。

1、技术演进

视联网的核心是通过高清视频的实时采集、传输与智能处理,实现物理世界与数字世界的深度融合。传统视联网依赖“端侧采集+云端处理”的集中式架构,随着4K/8K超高清视频普及、实时交互需求激增,集中式架构在算力成本、传输带宽、隐私安全等方面的瓶颈日益凸显。在此背景下,大小模型协同技术依托端云协同架构,推动视联网从“被动记录”向“主动感知、智能决策”跃迁。

1.1 视联网“全局智能中枢”

大模型凭借强大的泛化能力与多模态理解能力,作为大小模型协同的“大脑(nǎo)”,主要(yào)承(chéng)担(dān)三(sān)类(lèi)核(hé)心(xīn)任(rèn)务(wu):

①跨(kuà)模(mó)态(tài)语(yǔ)义(yì)解(jiě)析(xī):传(chuán)统(tǒng)视(shì)联(lián)网(wǎng)的(de)视(shì)频(pín)分(fēn)析(xī)多(duō)聚(jù)焦(jiāo)于(yú)目(mù)标(biāo)检(jiǎn)测(cè),而(ér)大(dà)模型通过处理对历史数据和实时数据关键帧检测、音视频分离后的数据,生成详细的密集文本描述,并通过融合文本、语音、传感器等多模态数据,可实现“视频内容的语义化理(lǐ)解(jiě)”。在(zài)智(zhì)慧(huì)城(chéng)市(shì)场(chǎng)景(jǐng)中,大模型可将交通摄像头的视频流与气象数据、交通管制通知关联,自动判断“暴雨天气下某路段积水是否需临时封路”,而非仅识别“车辆排队长度”。

②长时序决策推理:大模型的长上下文窗口使其能处理跨时间维度的视频序列,实现“因果关系推断”。在工业质检中,大模型通过分析大量设备运行历史视频,结合历史故障数据,预测“某轴承可能在48小时后因磨损引发停机”,而非仅瑕疵质检“当前是否有裂纹”。

③模型动态优化:大模型通过“预训练+微调”机制,可(kě)为(wèi)不(bù)同(tóng)边(biān)缘(yuán)场(chǎng)景(jǐng)的小模型提供定制化能力,通过教师-学生模型架构,将大模型知识迁移至小模型。在安防场景中,大模型可基于人脸识别数(shù)据(jù)训(xun)练(liàn)通(tōng)用(yòng)特(tè)征(zhēng)提(tí)取(qǔ)器(qì),再(zài)微(wēi)调(diào)为(wèi)适(shì)应(yīng)老(lǎo)旧(jiù)摄(shè)像(xiàng)头(tóu)低(dī)分(fēn)辨(biàn)率(lǜ)、夜(yè)间(jiān)光(guāng)照(zhào)的(de)小(xiǎo)模(mó)型(xíng),提(tí)升(shēng)边(biān)缘(yuán)端(duān)的(de)识(shi)别(bié)准(zhǔn)确(què)率。

1.2 视联网“边缘智能触手”

小模型聚焦端侧实时处理,通过模型压缩、知识蒸馏轻量化设计与GPU/NPU加速的硬件适配,解决大模型“云端延迟高、边缘算力弱”的矛盾,主要承担三类任务:

①实时特征提取:在远程医疗场景中,手术机器人的摄像头每秒生成8K视频流,若直接上传云端分析,延迟过高,无法满足该参加低延时的要求。小模型可在端侧完成关键区域的实时分割与特征提取,仅将压缩后的特征向量上传云端,大大降低延。

②隐私保护(hù)计(jì)算(suàn):视(shì)联(lián)网(wǎng)涉(shè)及(jí)大(dà)量(liàng)敏(mǐn)感(gǎn)数(shù)据(jù),小(xiǎo)模(mó)型(xíng)可(kě)通(tōng)过(guò)联(lián)邦(bāng)学(xué)习(xí)技(jì)术(shù)在(zài)本(běn)地(de)完(wán)成(chéng)模(mó)型(xíng)训(xun)练(liàn),仅(jǐn)上(shàng)传(chuán)梯(tī)度(dù)而(ér)非(fēi)原(yuán)始(shǐ)数(shù)据(jù)。在(zài)城(chéng)市(shì)智(zhì)慧(huì)社(shè)区(qū)的(de)人脸识别系统采用小模型,各小区独立训练本地模型,通过联邦学习共享人脸识别的泛化能力,避免用户面部信息跨区域传输。

③动态场景适配:不同边缘场景的视频特征差异显著,小模型可通过灵活快速适应新环境。

1.3 大小模型协同模式

①能(néng)力编排:通过大小模型能力编排,基于任务复杂度自适应分配计算资源,采用动态路由算法,将文本分类任务分配给小模型,图像生成任务触发大模型提高资源利用率。

②串行推理:将推理流程分解为数据预处理、特征提取、决策生成等阶段,各阶段由不同模(mó)型(xíng)处(chù)理(lǐ)。端(duān)侧(cè)小(xiǎo)模(mó)型(xíng)处(chù)理(lǐ)传(chuán)感(gǎn)器(qì)数(shù)据(jù),云(yún)端(duān)大(dà)模(mó)型(xíng)执(zhí)行(xíng)复(fù)杂(zá)任(rèn)务(wu),通(tōng)过(guò)小(xiǎo)模(mó)型(xíng)初(chū)筛(shāi)和(hé)大(dà)模(mó)型复核降低误检率。

③并行推理:首(shǒu)先(xiān)进(jìn)行(xíng)数(shù)据(jù)并(bìng)行(xíng),输(shū)入(rù)数(shù)据(jù)分(fēn)片(piàn)由(yóu)多(duō)个(gè)模(mó)型(xíng)并(bìng)行(xíng)处(chù)理(lǐ),实(shí)现(xiàn)多(duō)路视(shì)频(pín)流(liú)并(bìng)行(xíng)分(fēn)析(xī)。然(rán)后(hòu)进(jìn)行模型并行,大模型拆分为多个子模块分布处理,任务拆分为多个子任务,实现并行加速。

1.4 云边端架构支撑

大小模型的协同需依赖“云边端”三层架构的深度解耦与智能调度。云端负责全局数据存储、多模态训练、策略生成,通过协议接口为边缘端提供能力调用;边缘端部署轻量化模型,处理实时性要求高的任务,并将关键结果上传云端;终端负责高清视频采集,通过(guò)硬(yìng)件(jiàn)优(yōu)化降低传输带宽与计算负载。

2、核心挑战

尽管大小模型协同已在多场景试点落地,但其规模化发展仍面临很大挑战,需通过技术创新、政策引导与生态共建破解。

①算力分配矛盾

云脑与端(duān)手(shǒu)的(de)资(zī)源(yuán)博弈,大模型需要高性能GPU集群支撑训练,而小模型需边缘端低功耗芯片适配,二者在算力分配上存在(zài)天(tiān)然(rán)矛盾。需要继续推动模型轻量化和硬件定制化。一方面,采用知识蒸馏、稀疏化等技术压缩模型体积;另一方面,芯片厂商针对小模(mó)型(xíng)需(xū)求(qiú)开(kāi)发(fā)专(zhuān)用(yòng)AI芯(xīn)片(piàn),实(shí)现(xiàn)“算(suàn)力(lì)-功(gōng)耗(hào)-成(chéng)本(běn)”的(de)最(zuì)优(yōu)平(píng)衡(héng)。

②数据隐私风险

本地处理与全局优化是协同任务(wu)的(de)平(píng)衡(héng)难(nán)题(tí),视(shì)联(lián)网(wǎng)涉(shè)及(jí)大(dà)量(liàng)敏(mǐn)感(gǎn)数(shù)据(jù),小(xiǎo)模(mó)型(xíng)的(de)本(běn)地(de)处(chù)理(lǐ)虽(suī)能(néng)降(jiàng)低(dī)传(chuán)输(shū)风(fēng)险(xiǎn),但(dàn)大(dà)模(mó)型(xíng)的全局优化需要跨场景数据训练,二者存在隐私保护的冲突。

③标准体系滞后

由于技术多样与产业协同的机制障碍,当前视联网大小模型协同缺乏统一标准,不同厂商的大模型接口、小模型格式、边缘设备协议存在差异,导致系统孤岛现象。需要进一步推动政策引导和行业共建。明确大模型的接口协议、小模型的输出格式、边缘设备的兼容性要求,加速生态融合。

3、未来展望

随着大模型参数规模突破万亿级、小模型轻量化技术成熟,视联网的大小模型协同将从功能互补迈向深度融合,呈现三大趋势:

①多模态大小模型融(róng)合(hé)

未(wèi)来(lái)的(de)视(shì)联(lián)网(wǎng)大(dà)模(mó)型(xíng)将(jiāng)不(bù)再(zài)局(jú)限(xiàn)于(yú)单(dān)一(yī)模(mó)态(tài),而(ér)是(shì)融(róng)合(hé)文本(běn)、语(yǔ)音(yīn)、传(chuán)感(gǎn)器(qì)、甚(shén)至(zhì)物(wù)联(lián)网(wǎng)设(shè)备(bèi)状(zhuàng)态数据,形成全域感知大模型;小模型则针对具体场景开发专用版本,二者通过“模型插件”机制深度绑定。

②端云协同向端边云脑架构演进

随着边缘计算节点的普及,视联网将形成“终端采集-边缘端实时处理-边缘云区域协同-中心云全局决策”的多级架构。其中,边缘云承载区域级小模型集群,负责处理本区域内跨场景的协同任务;中心云则聚焦跨区域大模型训练,进一步提升响应速度,降低中心云负载。

③工具赋能到生态共生的产业变革

大小模型协同将推动视联网从技术工具升级为产业生态。通过在智慧农业、智慧城市、智慧工(gōng)业等场景的落地应用,实现从技术赋能向生态共生的范式转换,构建起“数据驱动创新、生态反哺技术”的良性循环体系。

4、结语

视联网的大小模型协同,本质是智能与效率的平衡,大模型赋予系统思考深度,小模型保障行动速度,二者共同编织出一张能感知、会思考、可执行的智能视频网络。随着技术迭代与生态完善,这张网络将深度渗透至城市治理、民生服务、产业升级的每一个角落,成为数字时代科技向善的最佳注脚。

作者:王晓宇、李杰、李萌

单位:中国移动研究院