投放短视频投放AI

视频大模型

投放 · 覆盖 短视频、投放、AI,约 14 分钟。

投放·约 14 分钟·更新 2026-09·纠错 / 投稿

概述

2024 年正值关键之年,OpenAI 出于某些考虑,一直对 Sora 秘而不宣。

在众人翘首期盼 Sora 现身却无果之时,其竞争对手们却纷纷亮出重磅手段来吸引眼球。

AI 视频领域的局势瞬间发生了巨大变化。


代表

1.0 AI 大模型(热门视频大模型合集)

Runway Gen-3

6月29日,著名生成式AI平台Runway宣布,其文生视频平台Gen-3 Alpha向部分用户开启测试。

Gen-3 Alpha是Runway在本月17日最新推出的产品,与上一代相比,光影、质量、构图、文本语义还原、物理模拟、动作一致性/连贯性等方面实现大幅度提升,剑指OpenAI的Sora。

Runway Gen-3 Alpha,作为Runway公司最新的视频生成模型,以其卓越的性能和广泛的应用前景,正在引领视频创作的全新潮流。该模型通过联合训练视频和图像数据,实现了从文本到高质量视频的快速转换,不仅提升了视频生成的保真度和一致性,还在人物动态、表情变化等方面展现了惊人的自然度和逼真度。无论是广告、动画还是短视频创作,Runway Gen-3 Alpha都能轻松应对,为用户提供高效、灵活的解决方案。随着技术的不断发展和完善,Runway Gen-3 Alpha将在内容创作、娱乐媒体等多个领域展现出更加广阔的应用前景。

可灵大模型

快手 AI 团队自研的视频生成大模型,2024 年 6 月 6 日,快手“可灵”视频生成大模型官网正式上线,可灵大模型已在快影 App 开放邀测体验。

可灵视频大模型(快手)详情

使用教程:https://docs.qingque.cn/d/home/eZQDp092-vzqbhb02KUdurkwP?identityId=1oEG9JKKMFv

Sora视频大模型:

1.0 AI 大模型 👈Sora 大模型优选文章

2024年2月,OpenAI旗下视频生成模型Sora正式对外发布。

Sora能够根据文本快速生成相对高质量的视频,目前已经在全球范围内掀起了讨论热潮,迅速成为当前最受关注的模型之一。

luma Dream Machine

官网

与其他 AI 视频模型相比,Dream Machine 具有以下几个特点:

  1. 速度快,120 秒即可生成 120 帧;
  2. 动作逼真,流畅,还融入电影级别的摄影技巧和戏剧张力;
  3. 角色一致性极强,能够模拟物理世界;
  4. 运镜自然,可匹配场景情感。

是Luma AI公司的产品,它集成了深度学习技术的精髓,具备令人惊叹的视频生成能力。无论是细腻的面部表情、逼真的光影效果,还是流畅的动作序列,Luma Dream Machine都能轻松捕捉并再现,为用户带来前所未有的视觉体验。其强大的物理模拟功能使得生成的视频场景更加真实,从重力下落到物体碰撞,每个细节都仿佛触手可及。此外,Luma Dream Machine还支持多种风格的视频制作,无论是现实场景还是幻想世界,都能轻松应对,满足用户多样化的创作需求。无论是在电影制作、广告创意还是游戏设计领域,Luma Dream Machine都将成为创意人士不可或缺的得力助手,助力他们打造出引人入胜的视觉盛宴。

Vidu视频大模型

2024年4月27日,在2024中关村论坛年会未来人工智能先锋论坛上,清华大学联合生数科技正式发布Vidu。该模型采用团队原创的Diffusion与Transformer融合的架构U-ViT,支持一键生成长达16秒、分辨率高达1080P的高清视频内容。Vidu不仅能够模拟真实物理世界,还拥有丰富想象力,具备多镜头生成、时空一致性高等特点,是自Sora发布之后全球率先取得重大突破的视频大模型,性能全面对标国际顶尖水平,并在加速迭代提升中。

其他大模型

Stable Video Diffusion

由Stability AI发布的视频生成大模型,采用多阶段训练策略,包括文本到图像的预训练、视频预训练以及高质量视频微调,提高了生成视频的质量和准确性

开源地址:https://github.com/Stability-AI/generative-models

官方提供文生视频地址:https://www.stablevideo.com/

demo体验地址:https://stable-video-diffusion.com/

huggingface地址:https://huggingface.co/stabilityai/stable-video-diffusion-img2vid

MoneyPrinterTurbo

一键生成短视频和文案语音的AI工具,只需提供一个视频主题或关键词,就可以全自动生成视频文案、视频素材、视频字幕、视频背景音乐,然后合成一个高清的短视频

github地址:https://github.com/harry0703/MoneyPrinterTurbo

StreamingT2V

根据文字提示生成2分钟的视频,采用自回归方法来逐帧生成视频内容,保证了整个视频与文本描述紧密相关且动态连续

项目及演示:https://streamingt2v.github.io

论文:https://arxiv.org/abs/2403.14773

github:https://t.co/h8nsZR8IHv

AnimateDiff

成熟的图生视频sd插件,能够利用从大规模视频数据集中学习到的运动先验知识,将静态图像转换为动态动画

开源地址:https://github.com/guoyww/animatediff

StoryDiffusion

开源的AI故事创作项目,支持生成剧情漫画和故事视频,基于一致性自注意力(Consistent Self-Attention)和语义运动预测(SemanticMotion Predictor)技术的创新生成模型

官方地址:https://storydiffusion.github.io/

github地址:https://github.com/HVision-NKU/StoryDiffusion

huggingface:https://huggingface.co/spaces/YupengZhou/StoryDiffusion#/

Video-LaVIT

开源图文视频生成大模型,将视频分解为关键帧和时间运动,通过视频标记器和时空运动编码器的设计,显著提高LLMs理解视频中复杂动作的能力

项目地址:https://video-lavit.github.io

MagicTime

专注于生成变形时间延迟视频的模型,采用基于DiT(Detection and Tracking)的架构,有效解决了现有文本到视频(Text-to-Video,T2V)生成模型在编码现实世界物理知识方面的不足

项目及演示:https://pku-yuangroup.github.io/MagicTime/

论文:https://arxiv.org/abs/2404.05014

GitHub:https://github.com/PKU-YuanGroup/MagicTime/tree/main

Follow Your Click

腾讯、混元、清华大学以及香港科技大学共同合作推出的图像生成视频模型,用户只需将任意一张照片输入该模型,然后点击相应区域并添加少量简单的提示词,即可使原本静态的图像区域焕发生机,轻松地转换为一段动态视频

论文链接:https://arxiv.org/pdf/2403.08268

GitHub: https://github.com/mayuelala/FollowYourClick

Animate Anyone

阿里巴巴旗下研究院发布的动画制作AI软件,能够自动生成角色、场景、动作等动画元素,并将其组合成完美动画作品,用户只需提供一些简单的参数即可

体验地址:https://humanaigc.github.io/animate-anyone/

github地址:https://github.com/HumanAIGC/AnimateAnyone

Champ

Champ 利用潜在扩散框架内的 3D 人体参数模型,实现了无与伦比的形状对齐和运动引导。捕捉复杂的人体几何形状和运动从未如此简单!

github地址:https://github.com/fudan-generative-vision/champ

DreamTalk

DreamTalk是一个基于扩散的音频驱动表达性头部生成框架,能够生成具有多种说话风格的高质量头部视频。DreamTalk在各种输入中表现出强大的性能,包括歌曲、多种语言的语音、含噪声音频和领域外的肖像画。

github:https://github.com/ali-vilab/dreamtalk

即梦

即梦视频大模型支持图片生成、智能画布和视频生成,能够将用户的文字描述转化为视频内容。适用于视频创作和内容创作,提供全新的视频创作方式,增加视频内容的多样性和个性化。每天免费送60积分,可生成5次视频。

体验地址:https://jimeng.jianying.com/ai-tool/home?activeTab=image

pixverse

PixVerse能够根据用户的文本描述或图片自动生成视频内容,支持4K分辨率的高清视频生成,并且在光影细节和运动准确性方面取得了突破。爱诗科技的PixVerse与国际头部视频生成产品Runway和Pika的用户规模处于同等量级。除了访问量,PixVerse的访问时长、频次和留存都比Pika好,平均停留时长是Pika的两倍多。同时,国内所有同类型视频生成产品加起来的访问量大约是PixVerse的三分之一。

4月,PixVerse推出C2V功能,用户能够创作并锁定角色,实现连续、可控的视频生成,避免出现“上一秒是梁朝伟、下一秒是刘德华”的情况。

5月,PixVerse正式上线Magic Brush运动笔刷功能,已在外网掀起试玩热潮。

体验地址:https://pixverse.ai/

Pika

Pika全面支持文字转视频、图像转视频、视频到视频。其中,Pika会将用户最喜爱的照片、绘画和素描变成身临其境的动人场景。同时,视频到视频方面,Pika可让用户为现有视频注入新的活力,修改框架中的任何内容,或随心所欲地更改风格。

公开信息显示,截至目前,Pika用户数达到数百万,每周生成数百万个视频。同时,Pika已租用数百个量级的GPU(图形处理器)芯片,用于模型训练和推理计算。

体验地址:https://pika.art/

更多工具请浏览:1.4 AI 视频

应用与前景

相关资源

朱光辉、王喜文:人工智能文生视频大模型 Sora 的核心技术、运行机理及未来场景

AIGC文生视频模型的发展前景与电视媒体的实践应对

更多相关分析报告:1.4 AI 视频

更多相关应用:1.4 AI 视频

相关资料

更多