如何使用 多模态 AI 视频生成器
通过文本提示和图片或参考视频,在统一的多模态工作流程中生成 AI 视频。
- 视觉参考 在提示词中使用 <Picture 1>、<Video 1> 和 <Audio 1>。点击标签即可插入。视频仅用于画面和动作参考,请单独上传声音。
- 视频描述 描述场景、动作和期望的视觉效果...
- 开始处理 运行工具并让它处理文件。
- 下载结果 完成!您的 AI 生成视频已准备好下载。
为什么人们使用此工具
- 提示词和结果不会被保存。
- 匿名且私密。
- 采用高级 AI 模型。
- 快速且简单的工作流。
FAQ - 多模态 AI 视频生成器
- 什么是多模态 AI 视频生成?该工具是如何工作的?
- 多模态 AI 视频生成将详细的文本提示词与视觉及音频参考素材(图片、视频和音频)深度融合。与单一处理文字或单张静态图片不同,AI 模型同时分析和理解多种媒体输入,从而高精度把控角色外观、运镜轨迹、场景构图、光影及情绪氛围,生成连贯逼真的高清视频片段。
- 如何在提示词中使用 <Picture 1>、<Video 1> 和 <Audio 1> 等参考标签?
- 上传参考文件后,系统会自动按顺序编号。在文本提示词中,您可以直接输入 <Picture 1>、<Video 1> 或 <Audio 1> 标签,也可以点击徽标直接插入。向 AI 清晰描述各素材的用途,例如:“<Picture 1> 中的角色在城市街道上行走,并呈现 <Video 1> 中的动态运镜”。视频参考提供画面动作与构图指导,音频则引导声音氛围。
- 上传支持哪些文件格式、大小和数量限制?
- 您最多可上传 3 张图片(JPG、PNG 或 WebP,单张不超过 10 MB)、1 个参考视频(MP4、WebM 或 MOV,时长 2–10 秒,不超过 30 MB)以及最多 2 个音频文件(MP3、WAV、M4A、FLAC 或 OGG,每个不超过 10 MB)。所有参考文件加起来的总容量不得超过 32 MB。
- 它与传统的文生视频(Text-to-Video)或图生视频(Image-to-Video)有何不同?
- 传统文生视频需要 AI 单凭文字凭空猜测场景,画面细节随机性较大;传统图生视频通常只能让单张静态图片产生微动。多模态生成则集两者之长:用图片锚定角色样貌,用参考视频锁定镜头轨迹与节奏,再配合文字和音频精准雕琢细节,实现极高的视觉一致性与创作掌控力。
- 生成视频的宽高比和分辨率是如何确定的?
- 工具会根据您上传的图片或视频参考素材自动匹配最佳宽高比,保持原汁原味的构图;您也可以在设置面板中手动挑选常用比例,例如宽屏(16:9)、适用于 Reels/TikTok/短视频的竖屏(9:16)、正方形(1:1)或 4:3。
- 生成视频需要多少积分(Credits)?计费规则是怎样的?
- 价格由服务器计算:没有视频参考时,费用为 90 Credits,加上超过 3 秒后每个已开始的额外秒数 5 Credits;至少包含一张图片加 10 Credits,每个独立音频参考加 5 Credits。有视频参考时,费用为 150 Credits,加上超过 3 秒后每个已开始的额外秒数 10 Credits;至少包含一张图片加 5 Credits,每个音频参考加 5 Credits。时长为 3–10 秒。例如,带视频参考的 10 秒视频为 220 Credits。开始前按钮会显示准确价格;请求失败或取消不会扣除 Credits。
- 生成视频通常需要多长时间?输出格式是什么?
- 多模态模型需要对多种媒体源进行深度解构与合成渲染,通常耗时约 2 至 4 分钟。最终成品输出为高画质 MP4 视频,您可以在内置播放器中即时预览,并无损下载到本地设备。
- 我可以将生成的 AI 视频用于商业用途吗?
- 可以。根据我们的服务条款,使用高级积分生成的所有视频均可无限制地用于商业项目、社交媒体、YouTube、营销推广和客户交付作品中。
- 我的数据和生成的媒体会被存储吗?
- 不会。为了保护您的隐私,所有上传的媒体和提示都会临时传输以进行处理,并在完成后立即删除。云端不会进行永久存储。您的聊天记录和所有生成的结果均专有地保存在您自己设备的浏览器本地。