音频翻译:把录音译成任意语言并生成字幕(附韩语实测)

把音频翻译成另一种语言,你只需打开 JotMe,选择"翻译音频",上传 MP3 或 WAV 文件,再挑选一种输出语言。JotMe 会分析说话人、翻译脚本、生成一条保留原始声音的配音轨,并在同一次运行里写出一个字幕文件。工具覆盖 200 多种语言、39,000 多个语言对,所以无论是一段韩语办公室录音、一节普通话讲座,还是一条越南语语音备忘,都能落到你真正在用的那门语言里。
任何音频翻译真正的难点,都出现在下载之后。你读不懂源语言,因此没有任何东西告诉你:刚拿到的文件说的到底是不是说话人说的那句话,还是一个"听上去差不多、却在决定结果的细节上对错参半"的版本。
本文把一段真实的韩语商务对话丢进 JotMe,将原始韩语文字稿与翻译后的字幕逐行对照,并交给你一套可复用的检查法——任何翻译后的文件,你都能在大约 5 分钟内跑一遍。
核心要点
- JotMe 对音频做了什么:JotMe 会先通读整段录音以获取上下文,再开始翻译,随后返回一条保留原始说话人声音的配音轨,外加一个能用任意文本编辑器打开的字幕文件。
- 可上传的音频格式:MP3、WAV、AAC、FLAC、M4A、AIFF、OGA、OGG、OPUS、WEBA 都能通过"翻译音频"标签页处理。
- 费用如何计算:JotMe 按文件时长的 20 倍以翻译分钟计费,所以本次测试用的这段 2.9 分钟韩语录音花费 58 个翻译分钟。
- 没人讲的那一环:每个工具都会甩给你一份输出。而字幕文件才是那个让你能逐行对照源文件、审核输出的东西——第 3 节会把它变成一套三步检查法。
JotMe 能翻译 MP3、WAV 这类音频文件吗
能。JotMe 通过翻译栏里的"翻译音频"标签页处理音频,面板接受 MP3、WAV、AAC、FLAC、M4A、AIFF、OGA、OGG、OPUS、WEBA 文件。把文件拖到左边,在右边设置好配音,整个任务一次跑完。
配音设置面板会问你 3 件事:从 200 多种语言中挑一种输出语言,勾着"匹配说话人声音"让翻译后的音轨听起来像现场那几个人,再勾着"生成字幕",这样你走的时候拿到的不只是配音音频,还有一个字幕文件。JotMe 在那块面板上用自己的话描述这项任务:选一种输出语言,在保留原有语气、意图与含义的前提下翻译音频。
很多人这一步会拿错工具。如果你只要页面上的文字,先把音频转成文字,再翻译那份文字稿。如果你要的是一个听众能直接播放的东西,就走配音流程来翻译音频——因为输出是声音,而不是一堵文字墙。

如何用 5 步翻译音频并生成字幕
翻译音频并生成字幕,只需 5 步:打开"翻译音频"标签页、添加文件、选好输出语言并开启字幕、确认翻译分钟、下载两份输出。下面这段韩语商务对话跑完全部 5 步,处理耗时不到一分钟。
第 1 步:打开 JotMe,在翻译栏里选择"翻译音频"
翻译栏有 6 个标签页:翻译文本、翻译文档、翻译图片、翻译视频、翻译音频、转写文件。凡是只有声音、没有画面的内容——语音备忘、讲座录音、采访文件、播客片段、歌曲分轨——都选"翻译音频"。

第 2 步:把音频文件添加到面板
把文件拖进"添加音频"框,或点击浏览。这里用的测试文件 1.7 MB,是一段 2.9 分钟的韩语办公室对话,发生在一位项目管理团队负责人和一名新入职的市场营销员工之间——这给了工具 2 个不同的声音、职场词汇,以及一堆需要译准的数字。
第 3 步:选好输出语言并开启字幕
设好输出语言,两个复选框都保持勾选。"匹配说话人声音"把说话人的身份带过语言这道坎,这与直播通话上的语音到语音实时翻译是同一个思路。"生成字幕"会在配音轨旁边写出一个带时间轴的字幕文件。保留你的声音、语气与意图——正是这一条指令,把一段配音和一段机器翻译的机械朗读区分开来。

第 4 步:确认翻译分钟
JotMe 在开始之前就把确切费用告诉你。这个文件的确认框写着 2.9 分钟 × 20 = 58 分钟,所以你是在数字摆在眼前的情况下批准这笔消耗,而不是事后才发现。

第 5 步:看着 4 个阶段跑完,然后下载两份文件
JotMe 把分析说话人、翻译脚本、生成配音轨、添加字幕作为各自独立的阶段来跑,进度列表会在每一阶段完成时标记出来。说话人分析作为一个独立阶段运行,正是一段两人对话能带着"正确的台词对上正确的声音"回来的原因。

当面板显示"配音音频已就绪"时,你会看到 2 个按钮:下载配音音频、下载字幕。配音后的 MP3 是给人听的,字幕文件则是你在第 3 节用来核对成果的东西。

几分钟内就能拿到准确的语音转文字翻译。这段 2.9 分钟的韩语文件在本次运行中,从"正在处理音频"跨到"配音音频已就绪"就在同一分钟内完成——它把一份翻译好的录音送到你手里的速度,比多数人写完那封"请同事解释一下这个文件在说什么"的邮件还要快。
不懂那门语言时,如何检查一段音频翻译
检查一段音频翻译的办法,是拿字幕文件去对照源文字稿——因为字幕把看不见的音频变成了你能逐行审阅的文本。对任何翻译后的文件跑下面这 3 遍,你大约 5 分钟就能抓出那些真正要命的错误。
- 第 1 遍,锚点核对:把源文件里的每一个数字、人名、日期、职位头衔和专业术语都列出来,再逐一确认它们都出现在翻译后的字幕里。数字和人名,正是机器翻译悄悄搞砸一笔生意的地方。
- 第 2 遍,语域核对:读一读问候语、结束语和任何道歉。礼貌在韩语、日语、印地语和泰米尔语里承载着含义,而逐字翻译会把这层含义压成一片空白。
- 第 3 遍,时间轴核对:从上到下扫一遍字幕时间戳。每一条字幕的起始时间都应晚于上一条的起始时间。一条乱序的字幕,就是在告诉你对齐出了偏差——一旦你把这些字幕装进视频,这个问题立刻就会显现。
我们把一段韩语办公室对话丢进 JotMe 后发生了什么
测试文件是一段有脚本的韩语职场介绍对话。金民秀(Kim Min-soo),一位在公司干了 18 年的项目管理团队负责人,见到了朴智恩(Park Ji-eun),一名刚从大学毕业的市场营销新员工。对话里有敬语、有工作交接、有实习经历,还有 8 个各自独立的事实锚点——这让它成为对任何号称"带上下文翻译音频、而非查字典翻译"的工具的一次公平压力测试。
第 1 遍完美通过。全部 8 个锚点都挺过了翻译:在公司 18 年、3 年前晋升为团队负责人、2 月大学毕业、工商管理专业、在一家小型广告公司做过 6 个月实习、做过社交媒体广告工作、会 Photoshop、带一个 5 人小组。没有任何遗漏,也没有任何走样。
第 2 遍才是有意思的地方。韩语职场用语承载着没有英文对应的含义,逐字直译会把一个彬彬有礼的职场人变成一个乞讨恩惠的陌生人。
这句韩语的意思
逐字直译
我请求你好好对待我,请帮我这个忙
JotMe 返回的结果
期待与你共事
这句韩语的意思
逐字直译
我是从一个普通职员开始干起的
JotMe 返回的结果
我从基层员工做起
这句韩语的意思
逐字直译
团队组长加上一个敬语后缀
JotMe 返回的结果
团队负责人
这句韩语的意思
逐字直译
我是市场营销。我被安排负责这项工作。
JotMe 返回的结果
我将负责市场营销工作。
这句韩语的意思
逐字直译
我负责项目管理编舞
JotMe 返回的结果
我主要负责项目管理工作。
最后两行值得注意,因为它们展示了一份功能清单展示不出来的东西。提供的韩语文字稿本身带着错误:一句话在说话人标签中途被拆成两段,另一句里出现了 안무("编舞"),而说话人明显说的是 업무("工作、业务")。JotMe 读的是音频和它周围的上下文,而不是那份有瑕疵的文本,两句都在中文里正确地返回了结果。一个逐字翻译的引擎,会把"项目管理编舞"直接送进你的收件箱。
这与运行在会议实时翻译上的是同一种理解行为——在那里,工具对一句话只有一次机会,也没法回头问说话人到底想说什么。
诚实打分:JotMe 能准确翻译音频吗
我们把两个音频文件、原始韩语文字稿和翻译后的字幕都交给 ChatGPT,请它给出 10 分制评分。它给了 9/10,而且点出了真实的缺陷,而不是把文件一挥而过。

- 第 3 遍抓到了一处时间轴错位。在 2:32 附近,一条时间戳为 00:02:35.740 的字幕,出现在了一条结束于 00:02:38.035 的字幕之后,于是有 2 行在文件里落到了对话顺序之外。
- 有几行读起来比自然口语更生硬。"你可以慢慢学,那让人松一口气"——这两句都准确,却都是英语母语者在那个当口不会说出口的话。
- 配音自始至终都称呼金民秀为"团队负责人"。忠于韩语、在英语耳朵里显得正式,值得在把文件发布到任何地方之前做一遍编辑。
一个带着 3 处指名缺陷的 9/10,比一个满分更有用,因为它明确告诉你:从下载到一份可发布的文件之间,究竟横着哪 3 分钟的清理工作。
为什么不能给 Google 翻译上传音频文件
Google 翻译没有音频上传入口,无论桌面端还是手机 App。它靠你的麦克风工作,Google 自己的文档也把这套流程描述为在浏览器里通过麦克风翻译口语,且在 Chrome 之外支持有限。转写模式和对话模式只存在于手机 App 里。
人们退而求其次的做法,是把一个 MP3 在笔记本麦克风旁边外放,指望工具跟得上。这种做法会拾进环境噪音、把 2 个说话人当成一路音流处理、产生不了任何音频输出,最后你手里剩下的是什么都递不给别人的东西。
Google 翻译仍然有一件事做得好,那就是快速读懂键入的文字。凡是以声音形式到来的内容,都需要一个为它而造的工具——这也正是为什么对 Google 翻译替代品的搜索,在音频和视频类查询上飙得最猛,而不是在文字类上。
如何把翻译后的音频变成可编辑的文字
把翻译后的音频变成文字,办法是拿 JotMe 随配音一起生成的那个字幕文件——因为这个文件里已经带着每一句翻译好的台词和一个附上的时间戳。用任意文本编辑器打开它,去掉时间戳,你就得到了一份目标语言的干净文字稿。
JotMe 用 WebVTT 写字幕,这是浏览器通过 HTML track 元素原生读取的 W3C 字幕格式。这一个文件能干三件事:
- 用它给一段视频加字幕
- 直接上传到 YouTube,或者
- 把它当作你这段录音的翻译文字稿来读。
对于那些你从一开始就不想要音频的任务,跳过配音。音频转文字工具负责从文件直接到文字稿这条路,而 JotMe 里的"转写文件"在你已经在应用内工作时覆盖同样的场景。一个需要把讲座变成可读形式的学生走这条路;一个需要把讲座讲成另一种语言的创作者,则走第 2 节的配音那条路。
两条路都从同一次上传开始,所以你永远不必在动手之前就猜自己需要哪一条。先把音频翻译一遍,之后再决定拿字幕文件做什么。
用 JotMe 翻译音频要花多少翻译分钟
JotMe 按文件时长的 20 倍以翻译分钟计费,所以每 1 分钟音频花费 20 个翻译分钟。本次测试里这段 2.9 分钟的韩语文件花费 58 个翻译分钟,确认框会在任何东西开始运行之前把这个数字显示出来。
在这里方案的门道比对文档更重要,因为音频吃额度的速度是直播通话的 20 倍。
任何第一次试这套流程的人,都应该先在免费方案上跑一段短片,再决定投入一段长录音。把那份输出拿去和免费语言翻译工具的选项比一比,就能很快判断出配音质量值不值得为你的使用场景花掉这些分钟。
什么时候该用 AI 翻译音频,而不是免费工具
当结果需要给你以外的人看懂时,就该用 AI 翻译音频。要个大概明白一条语音备忘说了啥,随便哪个免费工具都能干。而要一份准确、保留说话人身份、经得起客户审阅、还附带字幕文件的输出,那才是 JotMe 接下的活。下面是 3 个"这点差别决定结果"的场景。
开拓新市场的音乐人与创作者
一位独立艺人要向英语听众发行一首西班牙语单曲,随身带的不只是这首歌本身:一段来自波哥大的合写者语音备忘、一场音乐节上的法语媒体采访、一条凌晨 2 点用手机录下的制作人笔记。像这样的西班牙语转英语音频翻译工作,通常得送去录音棚,而录音棚按分钟报价。把同样这些文件走一遍配音流程,返回的是一条带原始声音的翻译音轨,字幕文件则给了唱片公司一个可以着手的底稿。当你要翻译一场自己从没安排过翻译的媒体见面会上的法语转英语音频时,同样适用。
靠录制讲座学习的学生
一个药理学学生旁听一系列普通话讲座,最后手里攒了 40 分钟音频,却无从下手。对英语转印地语语音音频翻译的搜索需求,大多正来自这一群人——用一种语言录下一节课,却用另一种语言学习的学生。把讲座里的音频翻译成印地语,你就得到一条通勤路上能听的配音轨,外加一个做笔记用的字幕文件——这比反复重放一段你听不懂的录音强得多。
活在语音备忘里的运营团队
金奈的一位物流协调员打开 WhatsApp,收到一条来自胡志明市货运伙伴的 90 秒 WAV 文件,发送时间是晚上 11 点,讲的是一次海关扣货。把它打字出来不现实,等到天亮也不现实。上传,把音频翻译成泰米尔语或英语,货就动了。每天都碰上这种事的团队,通常会升级到泰米尔语转英语实时翻译,好让下一次对话实时发生,而不是以文件的形式抵达。
当你为一家唱片公司、一位教授或一个付费客户专业地翻译你的音频时,字幕文件和配音轨两者都重要——因为一个证明了工作,另一个交付了工作。
在 JotMe 里你还能翻译什么
JotMe 带着 6 个翻译标签页。翻译文本处理粘贴进来的文字;翻译文档接收 PDF、DOCX、PPTX、XLSX、HTML、TXT、SRT、XLIFF 等,最大到 100 MB;翻译图片重新渲染 PNG、JPG、WEBP、GIF 文件并保留版式;翻译视频给 MP4、MOV、MKV 及另外 7 种格式配音;翻译音频覆盖前面列出的那 10 种音频类型;转写文件则从它们中的任意一种返回文字。每一个标签页都会在第一个词被翻译之前,对整份文件做同样一遍带上下文的通读,而且之后没有任何文件留在服务器上——这对未发行的音轨、考试录音和供应商通话都很重要。
你该选哪条音频翻译路线
当有人得听结果时选配音路线,当有人得读结果时选文字稿路线。供应商发来的一条语音备忘、一节你打算日后重温的讲座、一首你想在第二个市场发行的曲子,都属于第一类,JotMe 用一次上传就把它们处理掉——返回一个配音文件外加 200 多种语言的字幕。任何你需要以可搜索文字形式存在的东西,都从同一个字幕文件里去掉时间戳得来。
在你把任何要紧的东西托付给这个工具之前,先在你的第一个翻译文件上跑一遍回读检查。取一段 1 分钟的片段,用免费方案翻译音频,再把字幕对着源文件比一比。如果你想在通话之中、而不是通话之后拥有同样的准确度,实时翻译工具会在对话发生的当下就把它覆盖掉。
常见问题
免费方案能翻译音频吗?
能,最长 1 分钟的文件。免费方案每月含 20 个翻译分钟,而音频按文件时长的 20 倍计费,所以一段 60 秒的片段就会用掉整个月的额度。一个 3 分钟的文件需要 60 个翻译分钟,这就把它推到了每用户每月 $10 的 Pro 方案上。先在一段短片上测试质量,等你确认输出对你的语言对可用之后,再升级。
JotMe 接受哪些音频文件格式?
"翻译音频"标签页接受 MP3、WAV、AAC、FLAC、M4A、AIFF、OGA、OGG、OPUS、WEBA。WhatsApp 语音备忘通常是 OPUS 或 M4A,iPhone 录音是 M4A,多数讲座录音机写的是 MP3 或 WAV,所以常见来源都能直接上传,无需先转一道格式。
JotMe 会在翻译后的音频文件里保留原始说话人声音吗?
会,只要在配音设置面板里保持勾选"匹配说话人声音"。韩语测试文件返回时带着 2 个可区分的声音,它们的原有特征在语言切换后依然保持着;"分析说话人"作为一个独立阶段在翻译开始前运行,正是为了让这种分离成为可能。把这个复选框关掉,你得到的就是一段标准的合成朗读。
Google 翻译能翻译一个 MP3 文件吗?
不能,Google 翻译在桌面端和手机端都没有任何办法上传 MP3、WAV 或其他任何音频文件。它在麦克风模式、转写模式和对话模式里通过你设备的麦克风来听,所以最接近的变通办法,是把文件在笔记本旁边外放,然后接受麦克风拾到的任何东西。那种做法给你的是:没有配音音频、没有字幕文件、也没有说话人分离。
翻译后的音频文件配的是什么字幕格式?
你得到的是一个 WebVTT 文件,这是浏览器原生解析、YouTube 也接受作为字幕上传的 W3C 标准。每一条字幕都带着一个开始时间、一个结束时间和翻译好的那一行——正是这一点,让第 3 节里那套校验方法从一开始就成为可能。如果某个特定编辑器非要 SRT,就改一下扩展名或用转换器过一遍。
JotMe 会在翻译后保存我的音频文件吗?
任务完成后没有任何文件留在服务器上——正因如此,法务团队、研究小组和唱片公司才把敏感录音交给 JotMe,而不是交给一个留存条款不明的浏览器工具。在关闭面板之前把两份输出都下载下来,因为之后不会有任何东西替你等着。






