使用说明 返回

AI 任务平台 · 使用说明

本文档详细介绍 AI 任务平台各功能模块的使用方法,帮助您快速上手字幕分析、语音处理、图像生成、视频编辑等 AI 能力。

平台概览


目录


一、账号与登录

1.1 登录

访问平台首页后,系统会自动跳转到登录页面。

  1. 在登录页输入 用户名密码
  2. 点击「登录」按钮即可进入平台
  3. 若连续输错密码,可能会触发图形验证码(注册时使用)

登录页面

1.2 注册

如果没有账号,可在登录页点击「立即注册」:

  1. 填写用户名、邮箱、密码
  2. 输入图形验证码
  3. 提交后即可获得新账号(初始积分由管理员配置)

1.3 修改密码与登出

登录后,点击右上角用户名下拉菜单:


二、仪表盘

仪表盘是登录后的默认首页,提供个人任务概览。

仪表盘

功能说明

区域 内容
顶部统计卡片 总任务数、已完成、进行中、本月消耗积分
最近任务表 显示最近提交的任务,包含 ID、类型、状态、消耗积分、提交时间
操作 点击「详情」可跳转到任务详情页;点击「查看全部」进入任务记录

提示:仪表盘仅显示您自己提交的任务,不包含其他用户的数据。


三、任务记录

「任务记录」页面列出您提交过的所有任务,支持按状态筛选。

操作步骤

  1. 在左侧菜单点击「任务记录」
  2. 顶部可按状态筛选:全部 / 等待中 / 进行中 / 已完成 / 失败
  3. 表格显示任务 ID、类型、状态、消耗积分、提交时间、完成时间
  4. 点击「详情」按钮查看任务详情

任务详情页

任务详情页包含三个标签页:

取消任务:处于「等待中」或「进行中」的任务可点击「取消任务」按钮取消,取消后积分会自动退回。


四、积分明细

「积分明细」页面展示您的积分账户情况。

积分明细

功能说明

积分在任务提交时扣除,任务失败或取消时自动退回。


五、高光类工具

5.1 封面设计

「封面设计」是一个浏览器端工具,用于为竖屏视频制作带文字标题的封面图,支持自定义字体、颜色、描边、阴影等效果。

封面设计

操作步骤

  1. 上传背景图片:在左侧预览区点击或拖拽上传一张竖屏图片(JPG/PNG/WebP)
  2. 设置主标题(必填):
  3. 输入标题文字
  4. 选择字体(阿里巴巴普惠体、阿里妈妈方圆体、刀隶体、东方大楷等)
  5. 调整字号、颜色、描边色、描边宽、阴影色
  6. 设置每行字数(控制自动换行)和垂直偏移位置
  7. 设置副标题(可选):与主标题类似,可设置不同字体和样式
  8. 预览与下载:右侧实时预览效果,点击「下载封面」导出 PNG 图片

模板管理

模板仅保存字体、字号、颜色等排版参数,不包含标题文字内容。


5.2 高光定位

「高光定位」通过三步流程,从 SRT 字幕文件中提取视频高光片段,辅助视频剪辑。

高光定位

操作步骤

第一步:字幕导入

  1. 点击「导入字幕」按钮
  2. 选择剪映导出的 SRT 字幕文件
  3. 系统自动解析并显示字幕列表,左侧面板显示每条字幕的序号、时间、时长、文本

第二步:字幕优化

  1. 点击「字幕优化」按钮
  2. 系统调用 AI 模型合并相邻字幕并恢复标点符号
  3. 优化结果显示在中间面板
  4. 在底部设置「目标时长(秒)」,例如 60 秒(即希望最终高光片段总时长约 60 秒)

第三步:高光切片定位

  1. 点击「开始分析」按钮
  2. 系统调用大模型分析字幕内容,提取高光片段
  3. 结果显示在右侧面板,不同切片用不同颜色区分
  4. 点击「显示切片方案」可查看完整的切片方案(包含序号范围、时间范围、时长、内容)
  5. 点击「复制方案」可将切片方案复制到剪贴板

高级功能


5.3 高光切片

「高光切片」是基于「高光定位」结果的视频剪辑工具,可对竖屏视频进行语音识别、字幕匹配、自动切片。

高光切片

操作步骤

  1. 上传视频:在左侧素材区点击或拖拽上传一段竖屏视频
  2. 语音识别
  3. 点击「开始识别」对视频进行 ASR 语音识别
  4. 识别完成后显示字幕文本
  5. 字幕匹配:将识别的字幕与高光定位结果匹配
  6. 一键剪辑:点击「一键剪辑」按钮自动完成视频切片
  7. 导出:处理完成后可下载或预览切片结果

重要提示:视频处理过程中请勿关闭或刷新页面,也不要切换页签,以免处理中断。


六、音频工具

6.1 ASR 语音识别

「ASR 语音识别」将音频文件转换为文本,支持生成 SRT 字幕格式。

ASR语音识别

操作步骤

  1. 上传音频文件(支持 wav、mp3、m4a 等常见格式)
  2. 勾选「生成字幕(SRT格式)」选项(默认开启)
  3. 点击「开始识别」
  4. 等待处理完成,结果区域显示:
  5. 识别文本:纯文本结果
  6. 字幕内容(SRT):带时间戳的字幕格式
  7. 点击「下载文本」或「下载字幕」获取结果文件

限制:音频时长限制为 10 分钟,超过部分将自动截断。任务提交后可离开页面,稍后在「任务记录」查看结果。


6.2 TTS 语音合成

「TTS 语音合成」将文本转换为语音,支持多种预设音色和语音包。

TTS语音合成

操作步骤

  1. 选择音色:从下拉菜单选择语音包或预设音色
  2. 输入文本:在文本框中输入要合成的文字(最多 1000 字符)
  3. 点击「开始合成」
  4. 处理完成后,结果区域显示音频播放器和下载按钮
  5. 可在线试听或下载 WAV 音频文件

限制:文本长度限制为 1000 字符,超出部分会被截断。


6.3 SVC 语音克隆

「SVC 语音克隆」基于参考音频克隆音色,合成目标文本的语音。

SVC语音克隆

操作步骤

  1. 上传参考音频:上传一段包含人声的音频(用于克隆音色,最长 60 秒)
  2. 参考音频对应文本(可选):填写参考音频对应的文字,留空则自动用 ASR 识别
  3. 目标合成文本:输入要用克隆音色合成的文字
  4. 高级参数(可选,点击展开):
  5. 语音风格描述:如「温柔的女声」「欢快的男声」
  6. 扩散步数:10-50,默认 20(步数越多质量越好,速度越慢)
  7. CFG 强度:1.0-5.0,默认 3.0
  8. 语速:0.5-2.0,默认 1.0
  9. 修剪开头静音:默认开启
  10. 点击「开始克隆」,等待处理完成后试听/下载

说明:浏览器会自动将音频重采样为 24kHz 单声道 WAV 格式后再提交,无需手动处理。


七、图像工具

7.1 VTON 虚拟试穿

「VTON 虚拟试穿」将指定服装虚拟穿到人像照片上。

VTON虚拟试穿

操作步骤

  1. 上传人像图片:上传包含人物的全身/半身照片,或从下方示例中选择
  2. 上传服装图片:上传要试穿的服装平铺图,或从示例中选择
  3. 选择服装类型(必选):
  4. upper:上衣
  5. lower:下装
  6. overall:全身(连衣裙、连体裤等)
  7. 高级参数(可选):
  8. 推理步数(默认 50)
  9. 引导强度(默认 2.5)
  10. 随机种子(-1 为随机)
  11. 图片宽高(默认 384×512)
  12. 重绘背景:勾选后会重新生成背景
  13. 点击「开始试穿」,处理完成后可对比原图与试穿效果,支持下载

提示:人像图片建议使用站姿清晰、光照均匀的照片;服装图片建议使用纯色背景的平铺图。


7.2 T2I 文生图

「T2I 文生图」根据文字提示词生成图片。

T2I文生图

操作步骤

  1. 输入提示词(必填):描述你想要生成的图片内容
  2. 示例:一只可爱的小狗,在草地上玩耍,阳光明媚,高清照片风格
  3. 设置参数
  4. 图片高度:256-1536,默认 1024(必须是 8 的倍数)
  5. 图片宽度:256-1536,默认 768(必须是 8 的倍数)
  6. 推理步数:1-50,推荐 4-8 步(步数越多细节越丰富,速度越慢)
  7. 点击「开始生成」
  8. 处理完成后显示生成的图片,可下载

技巧:提示词越具体,生成效果越好。可以包含主体、场景、风格、光线等描述。


7.3 I2I 图片编辑

「I2I 图片编辑」基于上传的图片,按文字指令进行 AI 编辑。

I2I图片编辑

操作步骤

  1. 上传图片(必填):上传一张待编辑的图片,或从下方示例缩略图中选择
  2. 输入修改指令(必填):描述要做的修改
  3. 示例:添加太阳镜,变成油画风格,更换背景为海滩
  4. 推理步数:默认 8(1-50 可调)
  5. 点击「开始编辑」
  6. 处理完成后,左右对比原图与编辑效果,可下载结果

提示:指令越明确效果越好,可同时描述多个修改需求。


八、视频工具

8.1 视频去重

「视频去重」是一个综合性的视频混剪工具,支持主视频、画中画、插画、贴纸、背景音乐、片尾视频等多素材组合,并支持 ASR 字幕识别。

视频去重

操作步骤

1. 素材上传(左侧素材区)

素材类型 是否必选 数量限制 说明
🎬 视频 必选 可上传多个 第一个为主视频,其他自动作为画中画
🖼️ 插画 可选 可上传多张 在视频间插入的过渡图片
🎀 贴纸 可选 可上传多张 叠加在视频上的装饰图
🎞️ 片尾视频 可选 最多 1 个 拼接在结尾的视频
🎵 背景音乐 可选 1 个 支持 MP3/WAV/OGG/AAC

2. 操作区设置(右侧)

3. 模板管理

提示:使用模板可快速复用之前的素材配置,提高工作效率。


8.2 背景替换

「背景替换」是浏览器端工具,将人物视频的背景替换为指定图片、视频或纯色背景。

背景替换

操作步骤

  1. 上传人物视频:在左侧点击或拖拽上传人物视频
  2. 选择背景素材
  3. 图片/视频:上传一张图片或一段视频作为新背景
  4. 纯色:选择一种纯色作为背景
  5. 合成设置
  6. 颜色匹配:调整前景与背景的色彩融合度(0-1,默认 0.3)
  7. 点击「开始处理」
  8. 处理完成后,在右侧结果区预览并下载

重要提示: - 视频处理中请勿关闭或刷新页面,也不要切换页签,以免处理中断 - 浏览器会弹出确认对话框防止误关闭 - 建议使用背景简洁、人物边缘清晰的视频以获得最佳效果


8.3 视频超分

「视频超分」使用浏览器端 AI 模型将视频分辨率提升 2 倍(如 720p → 1440p)。

视频超分

操作步骤

  1. 选择视频:点击上传区选择一段视频文件
  2. 查看视频信息:系统自动显示原分辨率、预计输出分辨率和文件大小
  3. 开始超分:点击「开始超分」按钮
  4. 进度查看
  5. 左侧显示「原画(2x 放大)」预览
  6. 右侧显示「AI 超分视频」处理进度
  7. 下载结果:处理完成后点击「下载超分视频」

说明: - 超分处理在浏览器端完成,不占用服务器资源 - 输出分辨率为原视频的 2 倍 - 视频过大时(预计输出超过 1.9GB)会提示错误 - 处理过程中请勿关闭或刷新页面


九、常见问题

Q1:任务提交后多久能完成?

任务处理时间取决于任务类型和当前队列情况: - ASR/TTS/SVC:通常 1-5 分钟 - 图像任务(VTON/T2I/I2I):通常 30 秒-3 分钟 - 高光分析:取决于字幕长度,通常 1-3 分钟 - 视频处理(浏览器端):取决于视频时长和网络环境

Q2:任务失败怎么办?

  1. 在「任务记录」找到失败任务,点击「详情」查看错误信息
  2. 常见原因:积分不足、文件格式不支持、Worker 离线
  3. 失败任务不消耗积分,会自动退回

Q3:积分不够怎么办?

Q4:浏览器端视频处理中途断了怎么办?

浏览器端处理(背景替换、视频超分、视频去重)需要保持页面打开: - 处理中请勿关闭/刷新页面或切换页签 - 系统会弹出确认对话框防止误操作 - 如果意外中断,需重新上传素材处理

Q5:支持哪些文件格式?

类型 支持格式
音频 wav、mp3、m4a 等常见格式
图片 jpg、png、webp
视频 常见视频格式(mp4 推荐)
字幕 srt(剪映导出格式)

Q6:如何复用之前的设置?


如有其他问题,请联系平台管理员。