AI 照片说话生成器

上传图片

点击或拖拽文件到此区域上传
格式: jpg/png/webp, 大小: 不超过 20M 尺寸: 宽度和高度均在300-5000像素之间

示例
提示词21/500
反向提示词22/200
从本地上传

点击或拖拽文件到此区域上传
格式: mp3/wav/m4a, 大小: 不超过 500MB 时长: 最少 3秒,最多 2分钟, 超出部分将被自动裁剪

录制音频
  • 可上传音频文件或直接录制音频。
AI Talking Photo

照片说话使用指南

AI 照片说话功能可以用新语音驱动静态人像。把头像、角色或插画脸变成适合消息、讲解和社媒内容的短视频。

  1. 1上传一张您自己的照片。AI会驱动该照片运动和说话。确保您自己看起来美观清晰。
  2. 2上传一段音频或者使用TTS生成一段音频
  3. 3点击按钮生成视频

使用音频或文本转语音

上传准备好的音频,或输入脚本并选择可用语言和声音。提交前可预览生成语音,并用正向/反向提示词引导视觉结果。

照片和语音要求

请选择 JPG、JPEG、PNG 或 WebP 格式、最大 20 MB 的清晰人脸图片。图片宽高需为 300 到 5000 像素,比例为 0.4 到 2.5。语音可为 3 到 120 秒。

选择合适的头像工作流

AI 照片说话常见问题

  • 什么是 AI 照片说话?

    它会把静态人像变成视频,让可见人脸与上传音频或文本转语音同步说话。

  • 可以用文本让照片说话吗?

    可以。输入脚本,选择可用语言和声音,并在生成视频前预览语音。

  • 可以上传什么图片?

    可使用最大 20 MB 的 JPG、JPEG、PNG 或 WebP 图片。图片宽高需在 300 到 5000 像素之间,比例为 0.4 到 2.5。

  • 语音可以多长?

    当前流程支持 3 到 120 秒的语音,超过限制时会在裁剪前提示确认。