12 00:00:48,120 --> 00:00:51,400 Every cue lands on time.
整句时间戳
由完整语句起止时间生成的 SRT 字幕。
上传录音,识别语音,校对文稿与时间码,下载 SRT 字幕。
欢迎回来——今天我们聊聊字幕。
每个词都带着自己的时间戳。
最后一句落定,立刻导出 SRT。
MP3 保存的是声音,SRT 保存的是带开始和结束时间的文字。不能只改文件扩展名:需要先识别语音,再把每句话与音频时间对齐。
在上方选择音频文件并提交 MP3。识别完成后,先听关键片段,核对人名、专有名词与数字,再检查字幕时间,最后下载 SRT。可以把 SRT 与原音频或视频一起导入支持字幕的剪辑软件。
尽量使用人声清晰、背景音乐较少的录音。如果来源是多人会议,重点检查重叠说话和说话人变化。压缩噪声、口音和专有名词都可能影响识别;自动生成的字幕仍应校对。
MP3 转 SRT 需要语音识别,按转写权益和积分计费,具体额度以定价页及提交时提示为准。已有 SRT 文件转换成 VTT 则不需要重新识别音频。
SRT 是独立的字幕文字文件,不包含音频。下载字幕后仍需保留自己的原始 MP3,用于回听、剪辑或重新校对。
每日免费额度
每日免费额度最多可处理约 5 分钟音频;视频和链接每分钟消耗更多积分。
短期媒体留存
上传的源媒体通常会在约 3 小时后过期,除非某项功能明确提供更长留存。
安全结账
结账页面标识的支付服务商负责处理全球用户的银行卡付款。
7 种来源语言
自动识别,或指定英语、中文、日语、韩语、西班牙语、法语。
音频、视频或公开视频链接,工作台三种都接。
任务形态、语言和时长决定处理路径,你不需要比较供应商。
SRT、逐字时间戳、说话人轮次和干净全文——可单独下载,也可打包 ZIP。
每个完成的转写任务都交付同样的四层结果,随时复制或下载。
12 00:00:48,120 --> 00:00:51,400 Every cue lands on time.
由完整语句起止时间生成的 SRT 字幕。
{"w":"every","s":0.42,"e":0.61}
{"w":"word","s":0.63,"e":0.85}
{"w":"字","s":0.88,…}每个词或字一行 JSON,包含开始/结束时间。
S1 00:00:04 → 00:00:11 "Welcome back to the show." S2 00:00:11 → 00:00:19
按整句整理的说话人轮次,包含文本和词范围。
Welcome back to the show. Today, we're talking about subtitles — and why timing is everything.
带标点的完整转写文本。
1 积分等于 1 分钟音频。USD $20 入门包约可处理 20 小时音频。
$20
1,200 积分
媒体按语言和内容形态进行路由。可用的逐字时间戳、标点和说话人信息会归一化为一份可审阅的文字稿。
每日免费额度最多可处理约 5 分钟音频;视频消耗积分更快。登录后可在工作区保留结果。
源媒体通常会在约 3 小时后删除,除非某项功能明确提供更长留存。转写结果会保存在你的工作区。
自动识别可处理混合语言媒体;也可以指定英语、中文、日语、韩语、西班牙语或法语作为来源语言。
可以。创建按每音频小时 $1 计费的 API Key,或把公开 Skill 文件交给你的 AI Agent——它会继承你的账户权限。