录音说错一句话,能让 AI 直接修改吗?AuK 的语音编辑新能力
AuK 是能按文字要求生成和修改语音的 AI 模型。录音念错几个字、语气不合适或有噪声时,它能怎样帮忙?先看一段口播如何返工,再了解效果与本地使用条件。
AuK 是一个用文字指令生成和修改语音的 AI 模型。它可以把文字变成说话声,也可以接收一段已有录音,按要求修改其中的措辞、调整语气或处理噪声。对做口播、配音的人来说,它能参与的工作既包括生成一段声音,也包括录完之后继续修改。AuK 官方仓库介绍了这些任务。
腾讯混元、上海交通大学等团队在 2026 年 9 月 9 日公开了这个项目,随后又增加了更多本地运行支持。想先了解效果,可以从仓库提供的在线演示入口开始;在自己电脑上运行,则需要准备相应环境。本文先看它能怎样帮助处理录音,再看效果和硬件条件。
设想一段活动介绍:前面说得很顺,偏偏把“周六下午”念成了“周五下午”。重新录一遍,声音状态未必相同;只补这一句,又得找接缝。AuK 想提供的做法,是把原录音交给模型,直接告诉它这几个字应该怎样改。
改哪几个字,和怎么说,是两件事
AuK 的官方任务手册把内容编辑写得很具体:替换原有文字,在指定位置插入文字,或删除某段内容。按这个接口,上面的活动口播可以表达为“把‘周五下午’改成‘周六下午’”。这是依据文档构造的使用例子,实际结果仍需要试听。
如果文字都对,只是读得过于兴奋,处理的就是另一类问题:调整情绪,同时尽量保留说话内容和声音身份。改语速、调整音高、去除噪声也各有对应任务。它们共用文字指令入口,省去了先判断该找哪一种模型的麻烦。
这种统一入口的价值,在返工时尤其明显。创作者说的是“这里温和一点”“这几个字改一下”,软件内部才去处理声学参数。操作的起点更接近表达意图。
不过,生成式编辑输出的是新的音频。即使修改要求只有几个字,也值得连着前后句一起听:停顿是否合适,声音有没有突然变化,原本正确的词是否被带偏。文字改对了,只完成了这次返工的一部分。
模型得同时理解要求和原来的声音
读 AuK 的技术报告,可以把它的工作理解成两条线:一条处理文字和音频里的语义,另一条保留声音本身的声学信息。二者共同约束后续生成。
这也解释了一个直觉问题:既然知道要说什么,为什么还需要原录音?因为“说同一句话”和“让原来的这个人接着说”不是同一个要求。原音频提供的声音特征、说话方式,是编辑时需要参考的上下文。

*图:AuK 团队公开的模型架构。左侧展示输入指令和音频形成条件、再生成声音的关系;这是结构说明,不是某次编辑效果的测量结果。来源:官方仓库。*
语言入口也有自己的磨合成本。论文承认,模型对任意自由表达的要求还不够稳健。项目中的 Prompt Enhancer 是一个指令整理模块,会先识别你想做的任务,再把要求整理成模型容易处理的形式。初次使用时,明确地提出一个修改要求,比同时要求“自然、专业、活泼,还要更有感染力”更便于判断问题出在哪一步。
Flash 缩短等待,质量仍要靠耳朵判断
AuK 同时提供 Base 和 Flash 两个版本。Base 是完整模型,Flash 着重缩短生成声音的等待。AuK-Flash 模型卡说明,Flash 通过蒸馏训练学习完整模型的能力,用四步推理完成生成。这里的“步”指生成过程中的计算轮次。作者项目页报告,在相同测试条件下,Flash 相对完整模型取得约 4.5 倍的实际耗时加速。
这个数字对反复改稿有吸引力。假如每次修改都要等待,创作者很容易减少尝试,接受一个“差不多”的版本。等待缩短,才更愿意多试一种语气,再回头比较哪个合适。
但四步是推理设置,4.5 倍是作者的测试结果,两者都不能直接换算成你电脑上的完成时间。输入长度、运行环境也会影响等待。更省事的评估办法,是拿同一小段自有录音,分别比较 Base 和 Flash:修改是否到位,未要求修改的部分是否保留,哪一个更值得继续精修。项目页已有成对的声音示例,听之前先看清对应指令,才知道应该比较什么。
“1.5B”之外,还有整套运行环境
准备在自己电脑上运行的人,需要留意 AuK 的参数口径。B 表示十亿,官方所说的 1.5B 描述核心模型的参数规模;整套运行还需要负责理解输入的 Qwen2.5-Omni-3B 编码器,以及负责声音表示转换的音频 VAE 等组件。显存是显卡处理任务时使用的内存,不能只看核心模型的一个参数数字,就判断它够不够。
9 月 13 日加入的 CPU offload,也就是把部分模型数据卸载到系统内存的方式,可以减少 NVIDIA 显卡运行时的显存占用。下面摘取仓库的显存测试:同一张 A800-SXM4-80GB,使用 bf16 数值格式,模型为 AuK Base,指标是框架记录的峰值分配显存。
| 作者测试输入 | 不启用卸载 | 启用卸载 |
|---|---|---|
| 纯文字,输出 1.5 秒 | 24.78 GiB | 16.75 GiB |
| 5 秒参考音频 | 25.00 GiB | 16.98 GiB |
省下约 8 GiB 很实在,但表格没有证明普通 16GB 显卡可以完整运行。Mac 用户则需要跟随项目指出的 MLX 专门分支,不能照搬 CUDA 配置。
ComfyUI 是一种通过连接功能节点来搭建 AI 处理流程的工具。如果你已经在使用它,官方接入文档提供了加载和生成 / 编辑节点,也写明了当前输入加输出的序列时长限制。这意味着先处理短片段更符合现阶段的使用方式,不宜把整段长播客直接视作默认任务。
AuK 最值得先试的,仍然是开头那种明确的小修改。用自己有权处理的录音,把一句话改准,把一次停顿接顺。这样的返工如果能稳定完成,语音 AI 才会更自然地进入日常制作。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
本地模型还能快多少?ExLlamaV3 1.5 先省下一次内存搬运
ExLlamaV3 是帮助在自己电脑上运行 AI 大模型的工具,负责加载模型和安排计算。先弄清它在本地 AI 中的作用,再看 1.5 版本如何减少内存搬运、改善等待时间。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
DeepSeek V4.1 Flash:读得更省,能给长任务带来什么?
DeepSeek V4.1 Flash 是能理解文字和图片、帮助整理资料与回答问题的 AI 模型。先从它能处理的工作说起,再看这次长资料处理的改进,以及使用时需要留意的变化。