海螺 H3 全模式视频 API
一套接口覆盖纯文生视频、图生视频、视频参考、音频参考和多模态组合参考。使用纯梦授权码调用,任务失败自动退还冻结金额。
实例内 H3 工作流
| workflow_id | 参考图 | 输出 | 说明 |
|---|---|---|---|
u01_reference | 1–9 张 | 视频 | 多图参考基础版;官网扩展为模型节点支持的最多 9 张。 |
u02_image | 恰好 1 张 | 视频 | 单图生视频基础版。 |
u03_text | 0 张 | 视频 | 纯提示词文生视频基础版。 |
u04_fast_5_image | 1–5 张 | 视频 | 五图参考加速版。 |
u05_lossless_ltx_upscale | 1–5 张 | 1080P 视频 | H3 无损加速生成后进入 LTX 2.3 超分链路,耗时高于基础版。 |
auto | 按模式 | 视频 | 默认兼容模式,继续支持原有图片、视频、音频和多模态请求。 |
U01–U05 使用相同的纯梦授权码、任务查询、幂等与失败退款规则;显式指定 U01–U05 时只接受该工作流真实支持的素材组合。
生成模式
| 模式 | 需要的输入 | 用途 |
|---|---|---|
text_to_video | 只传提示词 | 纯文生视频,无需任何参考素材。 |
image_to_video | 1–9 张图片 | 人物、主体、场景或画面风格参考。 |
video_to_video | 1–3 个视频 | 动作、镜头、节奏或视频内容参考。 |
audio_to_video | 1–3 段独立音频 | 声音、对白、音乐或节奏参考。 |
multimodal_to_video | 两类及以上素材 | 图片、视频、音频自由组合参考。 |
auto | 任意合法组合 | 默认值,服务端根据实际素材自动识别上述模式。 |
旧请求不需要增加 mode,默认 auto,原有全能参考调用保持兼容。
参考素材能力边界
| 参考类型 | 上限 | 主要要求 |
|---|---|---|
| 图片 | 9 张 | 公开 HTTP(S) 地址;提示词使用 <Picture 1> 等编号。 |
| 视频 | 3 个 | 建议每个 2–15 秒;按 24fps 取帧;提示词使用 <Video 1>。 |
| 视频配套音轨 | 3 个 | 与参考视频按下标对应;不使用的位置可填 null。 |
| 独立音频 | 3 个 | 提示词使用 <Audio 1> 等编号。 |
纯文生视频无需参考素材;其他模式的素材必须是服务端可直接访问的公开 HTTP(S) URL,单个文件不超过 300MB。图片建议 JPEG/PNG/WebP,视频建议 MP4(H.264),音频建议 WAV/MP3。音频口径为“最多 3 个独立音频 + 最多 3 个视频配套音轨”,因此在 3 个参考视频都带独立配套音轨时,音频输入总数最多 6 个。
提交任务
POST https://puream.cn/api/ai/autodl-h3/tasks
鉴权可用 Authorization: Bearer 纯梦授权码 或 X-API-Key。建议始终传 Idempotency-Key,网络重试时沿用同一个值,避免重复创建和重复冻结。
| 变量名 | 类型 | 必填 | 说明 |
|---|---|---|---|
workflow_id | String | 否 | 默认 auto,保持原接口兼容。可指定 u01_reference、u02_image、u03_text、u04_fast_5_image 或 u05_lossless_ltx_upscale。 |
mode | String | 否 | 默认 auto,服务端按素材自动识别。也可明确传 text_to_video、image_to_video、video_to_video、audio_to_video 或 multimodal_to_video。 |
prompt | String | 是 | 生成提示词。引用素材按图片、视频、独立音频的顺序使用 <Picture 1>、<Video 1>、<Audio 1> 标记。 |
duration | Number | 否 | 目标时长,5–15 秒,默认 5。模型按 24fps 和 17 帧步长对齐,实际帧数可能略高于目标秒数。 |
width / height | Integer | 否 | 默认 864×480;每边 256–1536,必须是 32 的倍数,总像素不超过 1,500,000。 |
reference_images | Array<String> | 按模式 | 公开 HTTP(S) 图片地址,最多 9 张。模型会保留原图比例;大图按节点规则缩小,不会放大低清图。 |
reference_videos | Array<String> | 按模式 | 公开 HTTP(S) 视频地址,最多 3 个;每个参考视频建议 2–15 秒,服务端按 24fps 读取。 |
reference_video_audios | Array<String|null> | 否 | 与 reference_videos 按下标一一对应的音轨,最多 3 个;不使用的位置填 null,可只传前 N 项。 |
reference_audios | Array<String> | 按模式 | 独立参考音频,最多 3 个。与视频配套音轨分开计数。 |
ref_image_size | match | max | 否 | 默认 match,按生成画面像素面积缩放参考图;max 使用约 2048px 短边参考管线,身份一致性更强但明显更慢。 |
seed | Integer | 否 | 非负随机种子;不填由服务端生成。 |
纯文生视频示例
POST https://puream.cn/api/ai/autodl-h3/tasks
Authorization: Bearer 你的纯梦授权码
Idempotency-Key: 业务侧唯一请求号
{
"mode": "text_to_video",
"prompt": "一只白色小猫在雨后的霓虹街道上慢慢向镜头走来,电影感运镜",
"duration": 5,
"width": 864,
"height": 480
}全能参考示例
POST https://puream.cn/api/ai/autodl-h3/tasks
Authorization: Bearer 你的纯梦授权码
Idempotency-Key: 业务侧唯一请求号
{
"workflow_id": "u05_lossless_ltx_upscale",
"mode": "auto",
"prompt": "<Picture 1> 中的人物转身看向镜头,电影感光影",
"duration": 5,
"width": 864,
"height": 480,
"reference_images": ["https://example.com/person.jpg"],
"reference_videos": [],
"reference_video_audios": [],
"reference_audios": [],
"ref_image_size": "match"
}查询与下载
GET https://puream.cn/api/ai/autodl-h3/tasks/{task_id}GET https://puream.cn/api/ai/autodl-h3/tasks/{task_id}/download查询结果会返回最终识别的 mode,以及 timing.queue_seconds、timing.generation_seconds 和 timing.end_to_end_seconds。下载接口在任务完成后 302 跳转到纯梦托管的稳定成片地址。
计费与自动关机
U01–U05 统一按最终生成视频的实际时长计费,价格为 0.12 元/秒。提交时冻结 16 秒保护额度,即 1.92 元,用于覆盖成片容器可能多出的零点几秒;成功后使用 ffprobe 读取最终 MP4 的真实时长并结算,多冻结部分立即退回;排队、开机、模型运行等待、查询和下载不收费,失败不收费。
网站后台监控任务状态;任务完成后先把成片写入纯梦 OSS,再结算并释放实例。独立 AutoDL 看门狗每分钟复核任务租约和 ComfyUI 队列,实例无真实任务时自动关机。