多语言音轨:一个视频,多种语言
过去,为每种语言发布单独的视频文件曾是默认做法。但这也会带来诸多困扰:重复上传、存储和带宽成本增加、分析数据分散,以及持续存在的版本控制问题。.
我来教你如何发布 一个视频包含多条音频轨道 这样,观众就可以在播放器内切换语言,而无需您管理重复的视频文件。在此过程中,您将学习到实用的技术基础知识(容器、编解码器和元数据),以及一套能够避免常见问题(如音轨标签错误、同步偏差和播放问题)的制作工作流程。.
什么是多语言音轨?
A 包含多条音频轨道的视频 是一个视频文件(或一个流媒体包),其中包含一个视频流和多个可选音频流,例如英语、西班牙语(拉丁美洲)、法语。.
这是……背后的核心理念 多语言音频视频 策略:
- 请保留一个“主”视频素材。.
- 您可以将替代音频添加为额外音轨(供下载)或替代音频版本(供流媒体播放)。.
- 观众可通过播放器的音频菜单选择语言,如果元数据设置正确,许多平台会根据设备或浏览器设置自动选择默认语言。.
在全球化的数字环境中,这是触达国际受众的同时,既能简化内容管理,又能提升可访问性和用户体验的最简洁方式之一。.
先决条件和工具(开始之前)
内容与规划的先决条件
在创建一个 多语言音频视频, 确保这些决定得到落实:
- 画面定稿(最终剪辑), ,或者制定一份严格的变更控制计划。任何时间安排的变更都会迫使你重新同步所有语言版本。即使是一处微小的删减,也会导致返工量成倍增加。.
- 目标语言列表, ,包括:
- 语言变体(西班牙的西班牙语与拉丁美洲的西班牙语)
- 礼节与术语规则
- 品牌发音指南(产品名称、缩写、人名、地名)
- 分销计划
- 可下载为单个 MP4/MKV 文件进行播放,或者
- 通过 HLS/DASH 流媒体传输,并提供多种音频版本
- 法律许可
- 音乐许可必须允许制作新的配音或旁白版本
- 配音演员动态
- 受监管行业(医疗、金融、法律)的本地化审批
音频制作基准(推荐)
为了在多种语言中获得专业级效果,请统一您的音频目标:
- 采样率: 48 kHz (常见的视频标准)
- 编辑时的位深度: 24位 (根据编解码器的不同,输出文件可能是16位)
- 各轨道间声道布局的一致性:
- 立体声(2.0)适用于大多数网络用途
- 5.1/7.1 仅当您的平台和设备支持时才适用
- 响度目标(根据各地区或平台的要求选择):
- -23 LUFS (EBU R128,在许多地区普遍采用)
- -24 LKFS (ATSC A/85,在广播领域中常见)
- 峰值限制:
- 真实峰值通常限制在 -1.0 至 -2.0 dBTP 流媒体安全性(取决于平台)
软件和工具(按功能分类)
你不需要什么花哨的堆栈,但确实需要正确的分类:
- 用于参考素材导出、时间码和中间母带的视频编辑软件(NLE)
- 音频编辑器(DAW),用于编辑、降噪、混音和响度标准化
- 多路复用和检测工具:
- FFmpeg 用于复用多个音频轨道、设置元数据以及检查流
- 适用于 MP4/MKV 容器格式的工具,可在无需重新编辑的情况下添加音轨(如适用)
- 一款用于验证编解码器、音轨数量和语言标签的媒体检查工具
- 非必需但常见:
- 语音转文字(用于转录)
- 翻译管理或术语管理工具
- 对具有代表性的设备和浏览器进行质量控制测试
需要准备的资产
请准备好以下内容,以便本地化工作能够可预测地进行:
- 视频母版导出(高质量中间文件)
- 分离 M&E 干线 (音乐和音效)如有(对配音非常有帮助)
- 如有对话干,请进行清理
- SRT/VTT 字幕(即使目标是音频,字幕也有助于质量控制和无障碍访问)
- 发音指南和术语表
- 音轨命名规范(示例:“English”、“Español (LatAm)”、“Français”)
如果你想加快“生成语言音轨”这一部分的速度,可以 AI配音工作流程 这可能是一个不错的选择。. Vozo AI 配音 这是一个实用的选择,因为它能够自动配音,且配音的语调和语速与原文完全契合 60多种语言 并提供 300多种逼真的AI语音, ,这有助于您更快地实现对赛道的全面覆盖。.
分步指南:制作一部多语言视频
要确保此类项目不会出错,最快捷的方法是将其视为两条相互关联的管道:一条是制作管道(脚本、录音、混音),另一条是打包管道(音轨、元数据、播放器行为)。我将向大家展示一种能让这两条管道都保持可预测性的工作流程。.
分步工作流程
选择配送方式
准备好最终定剪母版和参考素材
编写翻译和配音脚本
按语言录制清晰的语音音轨
编辑、混音、标准化,然后打包并添加元数据
确定交付方式(文件下载还是流媒体播放)
预计时间: 30 至 90 分钟(若涉及多个平台,则时间更长)
目标: 选择单文件方案(MP4/MKV)或流媒体包(HLS/DASH)
首先,确定观众将如何接收 配有不同语言音频的视频. 这不仅仅是一种技术上的偏好。它决定了语言切换是在单个文件内部进行,还是通过指向其他音频版本的流媒体清单来实现。.
- 选项 A:一个可下载文件
- 最适合直接分发文件(培训门户、内部分发、离线播放)。.
- 您可以将多个音频轨道嵌入到一个 MP4 或 MKV 文件中。.
- 方案 B:流媒体套餐
- 最适合可扩展的OTT或网络流媒体服务。.
- 您发布了一个引用替代音频版本的清单(HLS 或 DASH)。.
选择容器格式
- MP4: 兼容性广泛,支持多音轨。.
- MKV: 灵活性极强,通常支持多种音频和字幕轨道。.
- WebM: 以网络为中心且支持多流传输,但在某些生态系统中适用性较弱。.
选择音频编解码器时应考虑兼容性
- AAC: 支持广泛且在语音方面效率高。一种常见的默认设置。.
- AC3: 在家庭影院场景中很常见,但并非所有地方都支持。.
- Opus: 适用于语音,在网页环境中很常见。.
了解文件大小带来的影响(这对获得利益相关者的支持至关重要)
通常情况下,多个音频轨所占的空间远小于视频流。计算示例:
- 192 kbps 音频 是关于……的 每小时每条语言音轨 86 MB
- 5 Mbps 视频 是关于……的 每小时 2.25 GB
因此,与复制整段视频所需的成本相比,添加几种语言通常只会使文件大小略有增加。.
确定切换的运作方式
- 游戏内音频选择菜单
- 根据用户设置或设备/浏览器的语言自动选择默认音频
确认平台限制
- 支持的最大音轨数
- 允许的编解码器
- 播放器界面是否遵循语言元数据
制定版本控制计划
- 母版视频版本 ID
- 各语言的音频轨道版本(v1、v2为更新版本)
专家建议: 在配音前锁定画面。调整时间点是导致本地化工作量激增的最快途径。.
准备好最终定剪母版和参考导出文件
预计时间: 30 至 120 分钟
目标: 为每种语言提供一致的时间基准
这一步往往决定了许多多语言项目是能保持井井有条,还是会陷入混乱。你的目标是确保每个语言团队都严格遵循完全一致的时序、帧率和参考提示进行工作。.
- 导出高质量的 夹层主视频 以便稍后进行复用。.
- 导出一个 时间码刻录参考 供译员和配音员审阅。.
- 确保帧率稳定:
- 如果可能的话,请避免以可变帧率(VFR)导出,因为VFR会增加同步漂移的风险。.
- 请确认您的音频参考轨没有杂音:
- 删除可能导致配音混淆的临时旁白。.
- 仅在需要时间提示时才保留引导音轨。.
创建并分享一个 提示表:
- 场次时间
- 扬声器标识符
- 屏幕上的文字提示
- 是否有任何“必须匹配”的内容(品牌名称、法律术语、屏幕提示)
如果带茎的话:
- 分别导出对话、音乐和音效。.
- 一个 M&E 干线 这尤其有价值,因为在替换对话的同时,它还能保留原有的氛围和节奏。.
定义 首尾填充:
- 如果您的工作流程有此需求,请添加 2 至 5 秒的开头广告和结尾广告。.
专家建议: 在最终编码之前,请继续使用未压缩或轻度压缩的音频文件(WAV)。.
制作翻译和配音脚本(本地化准备工作)
预计时间: 每种语言需2至10小时(具体时长视长度/复杂程度而定)
目标: 符合时间安排和意图、可直接用于录制的脚本
先从剧本入手,然后将翻译视为一项改编工作。如果剧本在技术上虽然正确,但篇幅过长,无法适应镜头时长,就会导致台词念得仓促、剪辑生硬,或者随着时间推移,剧情偏离原意。.
- 通过人工转录或语音转文字功能生成文字记录。.
- 为确保准确性而进行编辑(发言人变更、标点符号、品牌术语)。.
结合上下文翻译:
- 提供视觉素材(参考视频)。.
- 语气和受众层次。.
- 品牌语调至关重要。.
建立术语表:
- 产品名称、缩写、技术术语
- 应使用和禁止使用的表述(如适用)
处理时间约束:
- 与英语相比,有些语言的词汇量更丰富。.
- 在保持原意的前提下,对时长部分进行改写(这一点在剪辑紧凑的营销视频中尤为关键)。.
为脚本标注时间范围:
- 每行标注的入点/出点时间码可加快会话进度,并有助于防止时间漂移。.
选择配音风格:
- 画外音(可选择保留原声的低音)
- 完整配音(替换原版)
识别可能需要本地化的非对话音频:
- 屏幕上的文本显示
- 叙述与角色对话的区别
设置审批工作流:
- 语言审核(准确性和语气)
- 必要时进行法律或监管审查
专家建议: 为人名、地名和品牌术语提供发音说明和示例。.
如果您希望在保持语音风格一致的同时加快脚本转语音的制作速度,, Vozo 视频翻译器 正是为这一阶段而设计的:翻译成 110多种语言, 天然毛料, VoiceREAL™ 语音克隆,可选 LipREAL™ 口型同步,外加一位校对编辑,在锁定音轨前对输出内容进行润色。.
为每种语言录制语音音轨(录制清晰的音频)
预计时间: 短篇每种语言需1至4小时;长篇则需更长时间
目标: 音质稳定、噪音低且易于混音的语音录音
录音环节决定了不同语言之间能否保持一致性。如果每种语言都是在不同的声学环境中,采用不同的麦克风收音技巧录制的,那么切换语言时,听起来就会像切换到完全不同的制作风格一样。.
- 在不同语言中保持记录的一致性:
- 48 kHz 与视频匹配的采样率
- 保持相似的麦克风距离和房间声学处理,使语言切换听起来更加连贯
- 录制环境音:
- 有助于降噪和平滑处理
- 录制多个镜头:
- 特别是对于时间要求严格的广告语和品牌发音的关键时刻
- 监控常见问题:
- 爆破音、嘶音、口点击音、椅子发出的声音
- 削波(避免达到 0 dBFS)
做好会议记录:
- 取数字
- 推荐阅读
- 时间安排方面的问题以及需要补充的内容
保持性能的一致性:
- 不同语言版本中,能量、节奏和情感意图应保持一致。.
- 确认文本与屏幕提示及时间限制相符。.
同时保存原始和编辑后的合成文件:
- 原始存档使日后能够进行修正,而无需重新录制所有内容。.
专家建议: 如果需要唇形同步,请预留额外时间用于时间轴调整和微调。对于视觉真实感至关重要的项目(如访谈、人物特写、虚拟形象),, Vozo 唇形同步 能够将新音频与视频同步,使嘴型动作准确且自然。.
对每条语言音轨进行编辑、修整和混音(使其听起来更专业)
预计时间: 每种语言需2至8小时,具体时间视长度/复杂程度而定简体中文(大陆)
目标: 跨所有语言的、平台兼容且一致的音频
您的混音决策应针对两个关键时刻进行优化:首次播放和播放过程中的语言切换。当观众切换音轨时,会立即察觉到响度突变、音色变化或背景噪声水平的变化。.
对话编辑
- 缩短停顿时间以符合节奏。.
- 仅在风格上确有必要时才去除呼吸声(过度修饰可能会显得不自然)。.
降噪(请谨慎操作)
- 过度处理会产生比轻微噪声听起来更糟糕的伪影。.
- 使用较浅的渲染层,并频繁进行比较。.
匹配色调平衡
- 使用均衡器(EQ)以提升清晰度并减少混浊感。.
- 确保不同语言中的角色声音风格保持一致。.
动态控制
- 为提高可懂度而进行的压缩
- 对刺耳的“S”音进行去齿音处理
与M&E的混音
- 确保人声在音乐和音效之上,且不出现泵音。.
响度标准化
- 选择并应用一套统一的规格(例如 -23 LUFS 或 -24 LKFS).
- 确保不同语言的音量保持一致,以免切换音轨时产生突兀感。.
高峰期管理
- 限制真实峰值,以帮助防止编码后的失真。.
- 流媒体的常见安全范围大约为 -1.0 至 -2.0 dBTP (请确认您的平台)。.
出口战略
- 导出最终版本 每种语言的WAV文件 作为您的剪辑大师。.
- 稍后将其编码为目标编解码器(根据目标不同,可选 AAC、AC3 或 Opus)。.
专家建议: 确保每种语言的处理流程保持一致,然后仅对必要部分进行调整。正是这种一致性,才让多语言切换体验显得格外高端。.
为了快速迭代配音而不需要重新录制,, Vozo 录音室(视频重写版) 这一点值得考虑。当您已经完成配音录制后,利益相关方要求对剧本进行微调时,基于文本的工作流程尤其有用,因为您可以高效地进行润色或重新配音,而无需重启整个录音环节。.
正确打包音频轨道(播放器实际使用的元数据)
这是许多团队容易低估的一点。即使混音效果再完美,如果语言标签、曲目名称或默认设置有误,最终呈现的多语言体验仍会存在问题。.
- 语言代码: 尽可能使用标准标签(例如,, en, es-419, fr). 有些平台也接受三字母代码,但一致性比完美更重要。.
- 易于理解的名称: 设置用户能理解的曲目名称,例如“English”或“Español (LatAm)”。.
- 默认和备用行为: 在未检测到首选项时,确定哪首曲目作为默认曲目。.
- 通道布局和编解码器的一致性: 在可能的情况下,请保持各音轨的声道布局一致,因为当音轨之间存在差异时,某些播放器可能会出现无法预料的行为。.
如果要对单个文件进行复用处理,通常会使用 FFmpeg 之类的工具来添加音轨并设置元数据。具体命令会因源文件和目标容器而异,但处理目的始终一致:一个视频流、多个音频流,以及为每条音频轨设置明确的语言和标题元数据。.
优缺点:单文件清单与流式清单
单文件交付(包含多条音轨的 MP4 或 MKV 文件)
优点
- 简便的分发:只需管理一个文件
- 非常适合离线播放和内部门户网站
- 适合长期存储的清晰归档资料
缺点
- 不同平台对音频切换功能的实现方式各不相同
- 即使只是对音频进行微小修改,文件更新也需要重新发送完整的文件
- 有些生态系统对编解码器和元数据比较挑剔
流媒体套餐(支持 HLS/DASH 格式,含多种音频版本)
优点
- 可轻松扩展以适应网络和OTT需求
- 语言切换是许多播放器中的一项核心功能
- 更新音频版本时,无需频繁修改视频,操作起来更方便简体中文(大陆)
缺点
- 更多需要协调的环节:清单、打包、CDN 行为、播放器支持
- 需要进行仔细测试,以避免播放问题
关于性能的说明:虽然音频轨道的总大小通常仅占视频总大小的很小一部分,但如果播放器或打包方式效率低下,某些播放环境仍可能出现卡顿。因此,跨设备质量保证(QA)是绝对不可或缺的。.
避免最常见陷阱的实用技巧
- 标签错误的曲目(元数据问题): 请使用正确的语言代码和通俗易懂的曲目名称。如果元数据有误,播放器可能会显示令人困惑的选项,或错误地采用默认设置。.
- 同步漂移: 避免以可变帧率导出,并保持一致的参考处理流程。视频时长越长,漂移问题就越严重。.
- 编解码器不兼容: AAC 是一种安全的默认选项,兼容性广泛。AC3 和 Opus 虽然表现出色,但在确定采用前请先确认设备和平台是否支持。.
- 不同语言之间的响度不一致: 将音量标准化至目标值(例如 -23 LUFS 或 -24 LKFS),并控制真实峰值。听众在切换曲目时会立即察觉到响度突变。.
- 配音开始后的修改请求: 锁定图片或实施变更控制。如果变更不可避免,则对所有内容进行版本管理:主视频ID以及各语言的音频版本。.
发布检查清单:一次发布,触达所有人
多语言音轨让您能够 一视频多用:一种支持选择不同语言音轨的单一资源,既能减少重复工作,又能简化管理,并提升观众体验。 技术层面主要涉及几个可控的选择:容器格式(MP4/MKV)、编解码器(通常为AAC)以及正确的元数据。制作层面则关乎规范性:画面定剪、统一的音频标准(48 kHz、响度目标)以及全面的质量保证。.
- 生产前: 最终剪辑版、目标语言、术语表、审批、发行计划。.
- 录制前: 时间码刻录参考、cue表、M&E音轨(如有)、扩展语言的时序规则。.
- 包装前: 按语言分类的 WAV 母带,响度一致,真实峰值经过验证,文件命名规范。.
- 发布前: 已验证语言标签,已在播放器界面中审核了曲目名称,已测试默认语言行为,已完成设备和浏览器的质量保证测试。.
如果您希望在不牺牲自然效果的前提下,加快配音和语言音轨制作的速度,, Vozo 视频翻译器 以及 Vozo AI 配音 是编辑团队强烈推荐的工具,可高效制作多语言音轨,并提供语音保留选项,在需要追求逼真效果时还可选择唇形同步功能。.
只需将音轨制作一次,并正确打包,您就能发布一款真正的 包含多条音频轨道的视频 让全球观众都觉得这很自然。.