新闻
开云官方看到 AI 生成的几个时长 5 秒的视频时-开云(中国)Kaiyun·官方网站登录入口
发布日期:2026-08-21 01:12    点击次数:50
 

文 |   硅基星芒

当今国内两个最火的 AI 生成视频平台,非可灵和即梦莫属。

看成影视生人东说念主和 AI 心疼者,我准备组建一个纯 AI 的"影视团队",望望效用如何。

在雅致驱动之前,还有一个问题:文生图 + 图生视频 or 文生视频?

两个平台王人具备上述功能,那么两条路应该走哪条?

AI 给出的谜底是:使用"文生图 + 图生视频"的步伐具备更高的可控性;而"文生视频"的步伐粗略让视频更有"动态感"。

商量了一下资本和效用,我如故聘请了可控性优先。

01 第一步:AI 编剧,编写脚本

想拍一部电影出来,最初笃定得有编剧来写脚本。

我把先前公众号上发布过的一篇著述,以 PDF 体式丢给了当今公认性能刚劲的 Gemini 2.5 Pro。

不得不承认,翰墨方面,AI 当编剧如实是绰绰过剩。

分镜头脚本写得把稳其事,像我这种生人东说念主然则完全写不出来。

尤其是图生视频指示,涵盖了场景、动作、运镜、立场这些专科化的东西,搞定了大羁系。

02 第二步:AI 画师,画图"分镜图"

前边也曾说过,吸收"文生图 + 图生视频"的形态可以培育可控性。

脚本既然也曾有了,接下来的任务就是画图"分镜"。

我把 AI 编剧写好的这些首帧图片指示,十足交给了腾讯混元这个 AI 文生图模子。

比拟翰墨,AI 在图片鸿沟的智商昭彰有所下落。

好在混元生图的好意思术功底信得过,给出的大部分图片质地王人可以,基本相宜预期。

诚然,也有底下这些"流弊品":

举例,"一条水平的发光程度条,位于画面下方,滑块在肇始位置。配景是隐隐的彩色光影。"

AI 昭彰是没能认识指示。

以及,"一条高度精密的汽车坐蓐线,深广机械臂在协同使命,焊合时火花四溅,充满工业好意思感。"

此次则是逻辑无理,一群机械臂似乎正在破碎一辆完工的汽车。

03 第三步:AI 导演,让图片"动"起来

我把前边生成的静态图片和图生视频指示差异发给本次拍摄的导演——可灵和即梦。

联系词,"开机"以后不久,我就遭受了联想与执行的碰撞。

刚驱动,看到 AI 生成的几个时长 5 秒的视频时,我如故挺舒畅的。

毕竟,这些动态效用和光影变化在一个生人东说念主眼里也曾超越惊艳,画面也十分认识。

不外,跟着生成的视频越来越多,导演就驱动显露了,各自驱动生成一些很奇怪的东西。

问题一:"导演根本不按照脚原来"

这是最常见的问题,无法容忍的"不听指示"。

先来看一个让东说念主哭笑不得的例子:

图生视频指示 :

场景形容与动作 :   汽车的前大灯被激活,从一条细线驱动,然后骤然亮起,射出亮堂而敏锐的光束。沿途狭窄的能量光泽沿着车身的气动线条流动。

运镜形态 :   逐渐而富余戏剧性的朝上摇镜头(Tilt Up),从前轮驱动,朝上移动到挡风玻璃,让汽车嗅觉充满力量。

画面立场与质感 :   "豪杰特写镜头"。电影级,细致,高档感。增多细微的镜头光晕效用。

指示中写的结拜净白,汽车的前大灯被激活,但可灵生成的视频中却是从车身中间射出沿途后光,几许有点窘态其妙。

比拟之下,即梦生成的视频效用要好小数。

问题二:"牛顿看了王人得肃静"的物理和逻辑无理

让 AI 作念物理题,它轻车熟路;但让它生成视频,它似乎又没完全学会执行宇宙的物理礼貌。

"穿模"可以算是家常便饭了,即梦和可灵生成的视频王人存在这个问题,比如:

图生视频指示:

场景形容与动作 :   统统机器以惊东说念主的速率和好意思满的配合性协同使命,展现出极致的效用。机械臂抓取包裹,无东说念主车认识地避开和穿行。

运镜形态 :   在仓库内进行一个长距离、平滑的移动镜头(长镜头),一镜到底地展示统统这个词进程。

画面立场与质感 :   工业好意思学,科技感,顺序感。画面干净,动作认识。

另外,物理通顺的已毕看起来也很分歧理:

场景形容与动作 :   一颗闪亮的金色石子插足水中,激起一圈圈弘远而好意思艳的彩色震动,震动扩散的速率超越快,骤然照亮统统这个词水面。

运镜形态 :   俯瞰视角,逐渐放大(Zoom In)。

画面立场与质感 :   诗意,愉悦。用震动的爆发来标识多巴胺的骤然开释。

即梦生成的视频中,金色石子并非被插足,而是平直从水中涌现出来:

可灵则较好地完成了指示本体:

问题三:短时间内的失忆症

AI 生成的视频有一个要紧的劣势,那就是一致性着实是太差。

短短 5 秒之间,一个镜头的主角就可能发生大幅度的变化。比如:

场景形容与动作 :   表盘上的分针以极快的速率平滑地旋转一圈。刚一停驻,腕表屏幕上就出现一个柔软的、发光的脉冲动画。

运镜形态 :   静态特写。

画面立场与质感 :   当代,简易,高效。脉冲动画干脆利落,代表"投递"的提醒。

即梦生成的视频,我们暂且不谈"极快的速率"和"脉冲动画"已毕的如何,这表盘平直就换了个样:

即梦生成的视频,我们暂且不谈"极快的速率"和"脉冲动画"已毕的如何,这表盘平直就换了个样。

可灵生成的视频就莫得发生这个无理 :

若是在这样短的时间内王人无法保证一致性,统统这个词视频的不雅感笃定是好不到哪去。

04 使用感受

关于图生视频的 AI 平台,它们如实是刚劲的器具,但当今还不是成为及格的导演。

先说可灵,它的推崇相对更好一些。

关于物理宇宙的模拟和动态信得过感,它完成的可以,基本相宜执行宇宙中的物理规章。

其次,可灵关于指示中见解的认识深度和艺术评释智商更具上风。不仅是字面意旨,它还能在一定程度上认识翰墨背后的概述见解和用户想要抒发的边幅。

何况,可灵似乎并不是一个让作念什么就作念什么的稚子机器。它生成的视频中,有些画面并未在翰墨中写明,却能或深或浅地响应主题。

如斯说来,它更倾向于一个称心冲破范围进行尝试的"艺术家"。

另外,把柄"影评东说念主" Gemini 2.5 Pro 的反馈,可灵具备刚劲的镜头谈话掌合手力,粗略告捷完成"推拉变焦"、"朝上摇镜"等复杂运镜。

关于可灵生成概述 CG 场景,影评东说念主觉得在时刻质地和好意思学上王人也曾达到专科水准。

但是在这位"艺术家"阐扬联想力的同期,也带来了一些问题:

较低的图像保真度和时常的场景重构。

聘请性实践用户指示和跑偏的创意。

这就是可灵"导演形而上学"的势必代价,生成的视频可能会与料到的画面进出甚远。

再来说说即梦,比拟艺术家,它更保守一些。

即梦生成视频的上风在于极高的图像保真度和踏实性。

每个镜头的主体基本不会出现大幅度的误解和变形,画面也比较踏实。

这就意味着,即梦的"图生视频"功能,生成视频的质地很大程度上取决于图的质地。

此外,即梦关于复杂构图的指示也粗略较为精确的已毕,它关于指示的认识和实践智商更为可靠。

不外,即梦的流弊在于难以已毕物理上的信得过感,何况短缺一些动态逻辑。

上头一些令东说念主匪夷所想的形态大多出自它手。这亦然关于见解认识深度不够、短缺叙事智商的一种体现。

除此以外,"影评东说念主"也指出,即梦的镜头谈话认识和实践智商较为薄弱,险些无法完成较为复杂的电影运镜,裁减了视频的推崇力。

05 终末的小数方针

两个模子生成的视频王人也曾阐发,关于一般的平台用户而言,高难度指示经常带来的是失败的斥逐,时刻的范围尚未被冲破。

时刻角度来看:

AI 生成视频鸿沟内,"保真"和"创意"这两条中枢的时刻阶梯仍然存在博弈,弗成兼顾。

此外,视频时长亦然当今存在的一大为止。

无论是国内如祖国际的 AI 视频生成平台,大多将单个视频的时长严格限定在 5-10 秒内。

单个视频粗略抒发的本体有限,生成万古期、情节连贯的视频对这一鸿沟仍是弘远挑战。

而这关于用户来说,为编写请示词增多了难度。

写的太密致,模子无法认识,也无法在短短几秒内将本体抒发完全;

写的太毛糙,模子生成的本体经常与用户的意图相隔十万八沉。

资本角度来看:

通过刚劲的开导和算力进行腹地部署,再对模子进行微调,可能才是生成高质地视频的可靠聘请。

但,这资本可不是一般用户承受得起的。

即等于这两个在线运用平台,会员价钱也并未低廉。

单买积分的话,即梦上使用视频 3.0 模子 +720P+5 秒视频的最基本竖立是 1 元 1 条视频;

可灵上使用范例模式 +5 秒视频则是 2 元 1 条视频。

但把柄我的使用资格来看,想要生成的视频能达到一般短视频的水平,笃定是需要升级竖立并屡次生成、不停调试的。

而这个过程,支出笃定会不停增长。

因此,导演、录像师和后期淳厚们大可以松相连。

想让 AI 生成具备不雅赏性的影片开云官方,我们不妨再多些耐烦。