专题:2026云栖大会

“2026云栖大会 ”于9月22日-24日在杭州举行 。阿里巴巴ATH事业群技术副总裁 ,淘天集团首席科学家郑波出席并演讲。

郑波表示,文本、图像 、视频、声音、空间能力正在加速协同,从单模态能力走向多模态融合
有数据显示,63%的视频营销人员已经在使用AI视频工具;预计到2030年 ,AI图像与视频生成市场规模将达到608亿美元。
他指出,无论技术还是市场,全模态生成都在加速演进。人类感知世界 ,一直依靠图像、视频 、声音与交互 。过去,从想法到可视化结果,中间隔着一整条漫长生产链条。而全模态生成正在改变这一切 ,大幅降低想象落地的成本,让想法直接变成看得见、听得见、可交互的体验。未来,体验的供给会指数级增长 ,体验的边际成本将趋近于零 。
郑波在发言中预告,全新视频模型将于 11 月正式发布。“我们相信视频生成持续迭代,能够更高效自主地把创作想法落地 ,让每个人拥有更自由的创作表达。”他说 。
他判断:三年之内,会诞生原生全模态统一生成模型。一个模型同时完成图像 、视频、音乐生成,同时具备世界理解能力。不是多个模型简单拼接能力,而是原生一体化能力 。届时体验生产将打破模态边界 ,创作门槛进一步降低。
“从生成走向理解,从分散走向统一,从内容走向体验 ,从想象走向可见,这就是 AI 的下一步。”他说 。
新浪声明:所有会议实录均为现场速记总结 ,未经演讲者审阅 ,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。





