音频、视频与链接转写

MP3 转 SRT,生成带时间码的字幕。

上传录音,识别语音,校对文稿与时间码,下载 SRT 字幕。

多语言来源识别逐字、说话人、SRT、全文源媒体通常会在约 3 小时后删除
podcast-ep-12.mp3转写中自动语种: EN+ZH
00:00:01,000 --> 00:00:04,120说话人 1

欢迎回来——今天我们聊聊字幕。

00:00:04,480 --> 00:00:07,900说话人 2

每个词都带着自己的时间戳。

00:00:08,260 --> 00:00:11,540说话人 1

最后一句落定,立刻导出 SRT。

词数 2,184说话人 2字幕条 46SRT 就绪
每日免费额度最多可处理约 5 分钟音频;视频消耗积分更快。登录后可在工作区保留结果。

MP3 如何变成 SRT 字幕?

MP3 保存的是声音,SRT 保存的是带开始和结束时间的文字。不能只改文件扩展名:需要先识别语音,再把每句话与音频时间对齐。

从上传到下载

在上方选择音频文件并提交 MP3。识别完成后,先听关键片段,核对人名、专有名词与数字,再检查字幕时间,最后下载 SRT。可以把 SRT 与原音频或视频一起导入支持字幕的剪辑软件。

怎样得到更准确的字幕?

尽量使用人声清晰、背景音乐较少的录音。如果来源是多人会议,重点检查重叠说话和说话人变化。压缩噪声、口音和专有名词都可能影响识别;自动生成的字幕仍应校对。

生成字幕和格式转换有什么不同?

MP3 转 SRT 需要语音识别,按转写权益和积分计费,具体额度以定价页及提交时提示为准。已有 SRT 文件转换成 VTT 则不需要重新识别音频。

保留原始音频

SRT 是独立的字幕文字文件,不包含音频。下载字幕后仍需保留自己的原始 MP3,用于回听、剪辑或重新校对。

每日免费额度

每日免费额度最多可处理约 5 分钟音频;视频和链接每分钟消耗更多积分。

短期媒体留存

上传的源媒体通常会在约 3 小时后过期,除非某项功能明确提供更长留存。

安全结账

结账页面标识的支付服务商负责处理全球用户的银行卡付款。

7 种来源语言

自动识别,或指定英语、中文、日语、韩语、西班牙语、法语。

工作流程

00:01

拖入媒体或粘贴链接

音频、视频或公开视频链接,工作台三种都接。

00:02

按语言和媒体形态路由

任务形态、语言和时长决定处理路径,你不需要比较供应商。

00:03

导出你需要的每一层

SRT、逐字时间戳、说话人轮次和干净全文——可单独下载,也可打包 ZIP。

一次任务,四层交付。

每个完成的转写任务都交付同样的四层结果,随时复制或下载。

12
00:00:48,120 --> 00:00:51,400
Every cue lands on time.

整句时间戳

由完整语句起止时间生成的 SRT 字幕。

{"w":"every","s":0.42,"e":0.61}
{"w":"word","s":0.63,"e":0.85}
{"w":"字","s":0.88,…}

逐字时间戳

每个词或字一行 JSON,包含开始/结束时间。

S1 00:00:04 → 00:00:11
  "Welcome back to the show."
S2 00:00:11 → 00:00:19

说话人分段

按整句整理的说话人轮次,包含文本和词范围。

Welcome back to the show. Today,
we're talking about subtitles — and
why timing is everything.

带标点全文

带标点的完整转写文本。

按分钟付费,不按席位。

1 积分等于 1 分钟音频。USD $20 入门包约可处理 20 小时音频。

$20

1,200 积分

查看完整价格

常见问题

转写的准确率如何?

媒体按语言和内容形态进行路由。可用的逐字时间戳、标点和说话人信息会归一化为一份可审阅的文字稿。

免费能用多少?

每日免费额度最多可处理约 5 分钟音频;视频消耗积分更快。登录后可在工作区保留结果。

上传的文件会怎么处理?

源媒体通常会在约 3 小时后删除,除非某项功能明确提供更长留存。转写结果会保存在你的工作区。

支持哪些语言?

自动识别可处理混合语言媒体;也可以指定英语、中文、日语、韩语、西班牙语或法语作为来源语言。

脚本或 Agent 能用吗?

可以。创建按每音频小时 $1 计费的 API Key,或把公开 Skill 文件交给你的 AI Agent——它会继承你的账户权限。