1. 主页 > 设计资讯 > 热门新闻

豆包重磅黑科技!视觉认知或引爆AI

豆包重磅发布开源视频生成模型

2月10日,豆包大模型团队联合北京交通大学、中国科学技术大学,重磅发布了视频生成模型——VideoWorld,并且已开源代码与模型。

与Sora、DALL-E等主流多模态模型不同,VideoWorld开辟了新的路径,打破对语言模型的依赖,仅靠“视觉信息”认知世界。就像幼儿能在不依赖语言的情况下理解真实世界一样,VideoWorld通过浏览视频数据,让机器掌握推理、规划和决策等复杂能力。在仅有300M参数量时,它就已展现出可观的性能,达到专业5段9x9围棋水平,还能在多种环境中执行机器人任务。

AI纯视觉认知的重大优势

颠覆传统:不再是以前大家都在玩的“文本-视觉”对齐训练,而是直接给模型一个视频就可以学习掌握规律,据说其模型通用性可以提升10倍以上。

大幅节省成本:不需要文本标注数据了,可以省下很大一笔钱。根据豆包自爆的训练成本可以降低80%,这无疑是一个巨大的优势。

应用场景爆发:和视觉技术相关如自动驾驶这些需高精度环境理解的场景,搭配豆包的这个模型,就能花更少的钱干更大的事,迎来应用的爆发期。

国产AI大模型多模态能力持续提升

当前,DeepSeek掀起的行业变革浪潮持续发酵,不仅在人工智能产业链内引发连锁反应,还向其他行业渗透。它的火爆并非源于性能优势,而是凭借创新性技术路线,以超低算力成本实现超预期效果输出,为行业发展带来*思路。

此次豆包发布的VideoWorld视觉模型同样开辟了*技术路径,打破对语言模型的依赖,仅靠视觉信息就让机器实现对世界的认知并掌握复杂能力,有望进一步夯实国产大模型在多模态领域的技术实力。

长城证券称,国内AI大模型多模态能力正持续提升,如快手可灵AI大模型、字节豆包AI大模型等视频生成的效果正在持续提升,包括精准语义理解、一致性多镜头生成、动态运镜等。受益于底层技术能力的升级,国内AI应用持续迭代,token调用量持续增长,AI应用有望从中受益。

视觉认知核心标的一览

视觉算法:罗普特、虹软科技、云天励飞

视觉装备:凌云光、矩子科技、精测电子、天准科技、荣旗科技

工业相机:海康威视、大华股份、大恒科技、奥普特

本文由用户投稿发布,不代表本网立场,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至ffjianzhan@qq.com 举报,一经查实,本站将立刻删除。