音频、视频与链接转写

音频转 SRT,生成可校对的字幕。

上传音频或视频,或提供你有权处理的公开视频链接。无需比较不同转写引擎,即可获得带时间戳的文本、说话人分段、SRT 和干净全文。

多语言来源识别逐字、说话人、SRT、全文源媒体通常会在约 3 小时后删除
podcast-ep-12.mp3转写中自动语种: EN+ZH
00:00:01,000 --> 00:00:04,120说话人 1

欢迎回来——今天我们聊聊字幕。

00:00:04,480 --> 00:00:07,900说话人 2

每个词都带着自己的时间戳。

00:00:08,260 --> 00:00:11,540说话人 1

最后一句落定,立刻导出 SRT。

词数 2,184说话人 2字幕条 46SRT 就绪
每日免费额度最多可处理约 5 分钟音频;视频消耗积分更快。登录后可在工作区保留结果。

每日免费额度

每日免费额度最多可处理约 5 分钟音频;视频和链接每分钟消耗更多积分。

短期媒体留存

上传的源媒体通常会在约 3 小时后过期,除非某项功能明确提供更长留存。

安全结账

结账页面标识的支付服务商负责处理全球用户的银行卡付款。

7 种来源语言

自动识别,或指定英语、中文、日语、韩语、西班牙语、法语。

工作流程

00:01

拖入媒体或粘贴链接

音频、视频或公开视频链接,工作台三种都接。

00:02

按语言和媒体形态路由

任务形态、语言和时长决定处理路径,你不需要比较供应商。

00:03

导出你需要的每一层

SRT、逐字时间戳、说话人轮次和干净全文——可单独下载,也可打包 ZIP。

一次任务,四层交付。

每个完成的转写任务都交付同样的四层结果,随时复制或下载。

12
00:00:48,120 --> 00:00:51,400
Every cue lands on time.

整句时间戳

由完整语句起止时间生成的 SRT 字幕。

{"w":"every","s":0.42,"e":0.61}
{"w":"word","s":0.63,"e":0.85}
{"w":"字","s":0.88,…}

逐字时间戳

每个词或字一行 JSON,包含开始/结束时间。

S1 00:00:04 → 00:00:11
  "Welcome back to the show."
S2 00:00:11 → 00:00:19

说话人分段

按整句整理的说话人轮次,包含文本和词范围。

Welcome back to the show. Today,
we're talking about subtitles — and
why timing is everything.

带标点全文

带标点的完整转写文本。

按分钟付费,不按席位。

1 积分等于 1 分钟音频。USD $20 入门包约可处理 20 小时音频。

$20

1,200 积分

查看完整价格

常见问题

转写的准确率如何?

媒体按语言和内容形态进行路由。可用的逐字时间戳、标点和说话人信息会归一化为一份可审阅的文字稿。

免费能用多少?

每日免费额度最多可处理约 5 分钟音频;视频消耗积分更快。登录后可在工作区保留结果。

上传的文件会怎么处理?

源媒体通常会在约 3 小时后删除,除非某项功能明确提供更长留存。转写结果会保存在你的工作区。

支持哪些语言?

自动识别可处理混合语言媒体;也可以指定英语、中文、日语、韩语、西班牙语或法语作为来源语言。

脚本或 Agent 能用吗?

可以。创建按每音频小时 $1 计费的 API Key,或把公开 Skill 文件交给你的 AI Agent——它会继承你的账户权限。