跳到正文

#AI 音频

今日 1 条
今天10月3日周六
  1. OpenUtau 官方发布78

    OpenUtau 发布 0.1.571 Beta,新增表达式图与内置重采样器

    OpenUtau 发布 0.1.571 Beta,加入表达式图、内置 hifisampler、Worldline-R1.1、轨道效果 UI 和 DAW 集成 API。版本还新增歌手搜索、曲线编辑与移调、节拍器和 .m4a 导入,并优化后台处理、缓存、Linux 与 macOS 支持及多项错误修复。

    推荐理由:本次 Beta 更新扩展了表达式图、内置重采样器、轨道效果与 DAW 集成,并集中修复稳定性和兼容性问题,对歌声合成编辑流程影响明确。

10月2日周五
  1. RouteNote Blog66

    东京法院裁定特定商业利用下,声音可受公开权保护

    东京地方法院裁定,当声音被用于利用其商业吸引力时,可作为公开权所保护的人格要素。法院驳回津田健次郎要求删除视频的请求,也未裁定其权利已遭侵害或寻求赔偿,因此尚未明确AI仿声侵权的适用边界。

    推荐理由:厘清裁判认定、驳回下架请求与未认定侵权之间的区别,为评估AI声音仿制的商业利用边界及授权风险提供具体法律依据。

  2. RouteNote Blog60

    Lunacy Audio 发布 Nova 云端乐器平台,规划 AI 插件构建工具

    Lunacy Audio 于 9 月 17 日推出 Nova 平台,首批提供 10 款免费或付费乐器,并可通过免费的 Nova Host 在浏览器及 DAW 中使用。用户可先在网页中试用乐器,再将个人 Nova 资源库中的乐器载入 DAW。平台计划未来推出 Nova Builder,以预制效果模块和 AI 提示创建、修改、分享、混编及销售插件,但相关功能、开放范围和商业条款尚未确定。

    推荐理由:梳理Nova现有云端乐器工作流与Nova Builder规划,并明确区分已上线能力、待开发功能及尚未确定的商业条款。

  3. RouteNote Blog58

    Instagram为Edits加入面向创作者的AI聊天助手

    Instagram宣布在视频编辑应用Edits中加入AI助手,结合创作者账号数据、受众兴趣和平台趋势提供个性化建议。创作者可借此分析播放、关注、点赞、分享和视频留存等表现,并获得视频概念、开头、字幕和音频建议;该功能目前仅向美国Edits用户提供,免费使用受每日提示次数限制,更多使用量计划通过Meta One订阅提供。

  4. Csound 官方发布84

    Csound 7.0.0-beta.18 发布,新增 WASM 调试支持并修复大量问题

    Csound 发布 7.0.0-beta.18,新增 WASM 调试器的逐控制周期回调支持、CS_VARIABLE 软件总线,并加入非阻塞 readline opcode 与宿主文本输入 API。版本同时修复数组、结构、UDO、实时线程、FFT、滤波、MIDI、SoundFont、GEN 系列及 WASM 麦克风输入等问题,并更新 iOS 示例。

    推荐理由:本次 beta 版本集中更新 WASM 调试与输入支持,并修复大量数组、结构、实时处理、FFT、滤波及声音文件问题,直接影响 Csound 开发、插件维护与跨平台部署的稳定性。

10月1日周四
  1. Castos Blog67

    Castos 为播客 RSS feed 增加 WebVTT 转写文件支持

    Castos 现在会通过 RSS feed 将 AI 转写转换为带时间戳的 .vtt 文件,并添加到新节目及已有转写节目。创作者也可在单集编辑器上传 .vtt 文件,支持 Apple Podcasts 等读取 Podcasting 2.0 <podcast:transcript> 标签的播客应用显示字幕;文件上限为 2 MB,必须以 WEBVTT 开头并包含至少一条带时间的字幕。

    推荐理由:Castos 将 AI 转写和手动上传的 WebVTT 字幕统一接入 RSS feed,能直接改善 Apple Podcasts 等支持 Podcasting 2.0 的客户端显示,也明确了文件要求、替换方式与订阅权限。

9月29日周二
  1. Blubrry Podcasting37

    Podcast Insider 探讨播客制作中如何使用 AI,以及何时应划清界限

    Podcast Insider 的 Mike Dell、Dave Clements 与 MacKenzie Bennett 分享各自在播客制作中使用 AI 的方式,涵盖转录、章节生成、节目摘要、音频清理、研究和图片编辑。嘉宾强调应始终人工审核 AI 输出,并在辅助创作与用 AI 取代创意过程、削弱创作者声音及观众信任之间划清界限。

9月24日周四
  1. Pro Sound Effects50

    Pro Sound Effects加入Professional Sound Alliance,推动媒体与AI领域专业音效的公平授权

    Pro Sound Effects加入Professional Sound Alliance(PSA),参与推动媒体与AI领域专业音效的公平授权。PSA由音效设计师、艺术家、录音师、混音师及音效库公司等组成,关注未经许可抓取音效库训练商业AI模型,以及影视和游戏中未获授权使用声音的问题;音效专业人士、工具商、软件公司和工作室可在professionalsoundalliance.org签署请愿。

9月23日周三
9月18日周五
  1. FunASR69

    FunASR 1.4.16 发布:改进混合设备推理与 Transformers 指南

    FunASR 1.4.16 改进混合设备推理,保留 vad_kwargs、punc_kwargs 和 spk_kwargs 的设备配置,运行时覆盖不再修改已加载模型。新版本补充经测试的 Transformers 中英文指南,明确标点后处理需求,并附带 runtime-llamacpp-v0.2.6 的九项预编译运行时资源;测试不代表 CUDA、MPS 或 NPU 性能认证。

    推荐理由:更新明确修复重复推理中的设备配置传播问题,并补充 Transformers 使用与标点后处理指南,有助于部署者排查多设备推理和原生运行时的兼容边界。

9月11日周五
  1. whisper.cpp 官方发布73

    whisper.cpp 发布 v1.9.4

    whisper.cpp v1.9.4 已发布,Nightly build 为 b5130。更新调整了语言自动检测与解码器状态管理,使服务端在检测响应中返回语言,并修复 whisper_mel 未初始化读取和空输入等问题。版本还增加 Windows On ARM 发布支持、更新 OpenVINO 模型转换与文档,并调整多个后端和 CI 配置。

    推荐理由:此次发布补强语言检测与服务端响应,并修复重复调用、缓存和输入读取问题,同时更新 OpenVINO 支持及多平台构建配置,对语音识别部署与维护有直接参考价值。

9月10日周四
  1. Ableton Blog71

    Machinedrum 谈 BL00MS、Ableton Live 与移动创作流程

    Machinedrum(Travis Stewart)在最新迷你专辑 BL00MS 创作访谈中说明了 Ableton Live、Note 与 Max for Live 的工作流,并分享移动采idea、hocket 编排和插件替代方法。

    推荐理由:访谈呈现从 Impulse Tracker 到 Live、Note 与 Max for Live 的工作流演变,hocket、设备替换和 A/B 复现等细节,对电子音乐制作决策较有参考价值。

9月6日周日
  1. sherpa-onnx 官方发布74

    sherpa-onnx v1.13.7 发布更新多平台与语音识别功能

    sherpa-onnx v1.13.7 修复 iOS、Windows arm64、CI 构建及在线标点模型初始化问题,并新增 Rust 的 iOS 支持、hello world Tauri 示例和 JavaScript API 的批量解码。

    推荐理由:本次更新覆盖多平台构建、Rust 与 JavaScript API、流式识别及模型兼容性,能帮助使用者评估跨平台部署与识别接口调整带来的工程影响。

9月5日周六
  1. Piper TTS67

    Piper 发布 v1.8.0,新增基于 TLTK 的泰语 phonemizer

    Piper v1.8.0 新增基于 TLTK 的泰语 phonemizer,训练时可使用 th extra --data.phoneme_type thai,合成时可在 voice config 中设置 "phoneme_type": "thai"。

    推荐理由:新增基于 TLTK 的泰语 phonemizer,明确训练配置、语音配置及 IPA warmstart 兼容性,并同步补充安装脚本与 CI 测试,能直接影响泰语 TTS 的训练和合成流程。

8月20日周四
  1. Ableton Blog65

    Sudan Archives 展示传统弦乐与现代制作工具的创作现场

    Sudan Archives 在 Ableton 短片中展示工作室,并讲解如何将传统弦乐技法与 Ableton Live、Move 和其他设备结合。她使用无线系统、音箱踏板、干声录音、声像与自动化制作多层编曲,也分享了在 AI 时代维持创作意图与技术平衡的看法。

    推荐理由:文章通过工作室参观与访谈,具体呈现小提琴、Move、Ableton Live及效果器如何参与写作、录音和混音,为独立音乐创作者提供可参考的技术流程与现场配置思路。

8月19日周三
  1. Kokoro ONNX 官方发布68

    Kokoro ONNX 发布 model-files-v1.1 模型文件

    Kokoro ONNX 发布 model-files-v1.1,提供 Kokoro v1.0 与 v1.1-zh 的全精度、FP16 和 INT8 ONNX 文件,以及对应语音包。

    推荐理由:三种精度文件及体积、相关性和语音包信息便于部署选择;时长输出、浮点速度输入与图内嵌配置还能直接改善时间戳生成、变速稳定性及分发完整性。

8月18日周二
  1. sherpa-onnx 官方发布70

    sherpa-onnx 发布 Flutter 演示与多平台构建资源

    sherpa-onnx 发布 Flutter Web 演示及面向 Android、Linux、macOS、Web 和 Windows x64 的可下载资源。内容覆盖 Silero VAD、文件与麦克风输入的 VAD+ASR,以及离线和在线标点恢复,并列出 FireRed ASR、FunASR Nano、Whisper、NeMo Parakeet、Qwen3 ASR 等模型。

    推荐理由:集中提供跨平台 Flutter 示例与模型组合,便于开发者按文件、麦克风及标点恢复场景验证 VAD、ASR 和标点处理流程。

8月16日周日
  1. Mastering The Mix73

    如何在混音时避免 AI Stems 失去原有平衡

    Suno Studio 2.0 支持 Premier 导出无数量限制的 32-bit WAV 或 MP3 多轨及单独 stem,为 AI 音乐进入 DAW 混音提供了更完整的素材入口。文章建议先确认轨道对齐并降低电平,再处理串音、相位抵消和动态冲突;对分离伪影应采用窄带、局部处理,并以参考曲目和实际听感验证最终混音。

    推荐理由:文章把 AI stems 导入 DAW 后的增益、相位、串音和分离伪影拆成可执行的处理顺序,并强调用参考曲目校准判断,适合制定混音工作流。

8月13日周四
  1. Pro Sound Effects38

    为何声音比以往更重要:Pro Sound Effects呼吁保护专业声音创作者权益

    Pro Sound Effects呼吁媒体与AI企业合法授权声音,并共同推动专业声音创作者权益保护。自2004年起,其团队已制作超过120万条声音,支持50多位声音艺术家和20人的核心团队。公司指出,AI企业未经许可抓取和盗用专业音频将危及创作者生计,而目前专业声音领域仍缺乏统一联盟。

8月11日周二
  1. sherpa-onnx 官方发布76

    sherpa-onnx 发布 v1.13.5 更新模型、运行时与多平台支持

    sherpa-onnx 发布 v1.13.5,更新 Nemotron、Moonshine、Inflect 等模型支持,并改进 QNN、WebAssembly、SPM、Flutter 和多平台构建。此次版本还修复 ScaleSilence、Piper TTS、Paraformer、FireRedASR、Pyannote 及多项崩溃、内存和数值计算问题。

    推荐理由:本次更新覆盖模型导出、QNN 与多平台运行时,并集中修复 ASR、TTS、VAD 和音频处理中的稳定性与兼容性问题,对部署和制作流程有直接参考价值。

8月7日周五
  1. Sonarworks Blog60

    用AI制作C-pop、Mandopop和Cantopop人声的指南

    SoundID VoiceAI通过转换创作者亲自录制的人声音色,制作C-pop、Mandopop和Cantopop的风格化参考人声。中文声调与咬字会由源演唱保留,模型不会纠正发音,因此非母语者应让流利演唱者录制引导人声,并匹配模型适合的输入音域。中文人声扩展包提供10个声音,支持DAW内本地免令牌处理;文章还说明了Unison Mode堆叠、授权来源及商业输出规则。

    推荐理由:文章围绕华语流行、粤语流行和C-pop的AI音色转换制作,解释声调语言中的演唱录音、输入音域、DAW内迭代及混音处理要点,并说明授权与使用边界,对中文人声制作和前期参考制作具有直接决策价值。

  2. sherpa-onnx 官方发布73

    sherpa-onnx 发布 v1.13.4,新增 QNN 支持并修复 Windows 路径问题

    sherpa-onnx 发布 v1.13.4,导出 Parakeet、Whisper 和 nemotron-speech-streaming-en-0.6b 等模型至 QNN,并加入对应 C++ 运行时支持。

    推荐理由:本次更新覆盖 QNN 模型导出与 C++ 运行时、Windows 路径兼容和 ASR 结果处理,并扩展 JavaScript 非流式 API 的逐流热词支持,对部署与语音识别集成有直接参考价值。

8月4日周二
  1. whisper.cpp 官方发布64

    whisper.cpp 发布 v1.9.2,更新 VAD 与 CJK 支持

    whisper.cpp 发布 v1.9.2,改进了 VAD 语音分段、时间戳映射和参数解析,并使 voice_length() 支持 UTF-8 CJK。版本还涉及 Parakeet、Android 示例推理性能、Ruby 语音分段 API 及 Nix 构建修复。

    推荐理由:本次更新覆盖 VAD、CJK 文本处理、Android 推理性能与构建兼容性,并新增 Ruby 的语音分段 API,对语音识别工具的集成和部署维护具有直接参考价值。

7月23日周四
7月4日周六
6月26日周五
6月19日周五
  1. whisper.cpp 官方发布35

    whisper.cpp 发布 v1.9.1

    whisper.cpp 发布 v1.9.1 版本,由 danbev 提交。此次版本在 Windows BLAS 的持续集成配置中新增 GGML_NATIVE=OFF 和 GGML_BMI2=OFF,并包含从 v1.9.0 到 v1.9.1 的完整变更记录。

6月17日周三
6月2日周二
4月30日周四
  1. Steinberg Blog66

    Dorico 6.2.20 发布并支持 Cantai 人声合成插件

    Steinberg 发布 Dorico 6.2.20,为 Dorico Pro 6、Dorico Elements 6 和 Dorico SE 6 增加对 Cantai 人声合成 VST 插件的支持。Cantai 可通过播放模板或手动添加到 Dorico,并为指定乐器自动渲染、更新人声部分;该更新还包含 25 项以上修复,包括 iPad 项目名称含逗号时无法打开的问题。

    推荐理由:本次更新明确了 Cantai 在 Dorico 6 中的加载、分配与渲染流程,并补充了兼容问题和编辑功能修复,对人声合成与谱曲工作流具有直接配置价值。

4月11日周六
  1. Decent Samples66

    Decent Sampler 1.20.0 新增波表引擎

    Decent Sampler 1.20.0 新增波表引擎,可通过扫描单周期波形帧并交叉淡化来生成复杂、变化的音色。当前支持波形类型、文件路径、位置与帧插值四项参数,其中位置可实时调制;文件格式基于 Serum 兼容的 RIFF WAV。

    推荐理由:明确说明新增引擎的参数、绑定层级与文件格式,能帮助采样乐器开发者配置可实时调制且支持帧插值的波表音色。

4月10日周五
  1. Pro Sound Effects57

    游戏音频工具指南:构建可交付的专业工作流

    Pro Sound Effects 介绍构建游戏音频制作栈的工具选择与组合方法,比较 Wwise、FMOD、Unity、Unreal、Nuendo、Pro Tools 和 Reaper 的工作流特点。文章还覆盖音效资产管理、空间音频、版本控制、项目管理、自动化及 AI 降噪和分轨工具,并给出连接 Wwise、SoundQ、Pro Tools 或 Reaper 的实践路径。

3月11日周三
  1. Image-Line News23

    FL Cloud Pro 有哪些新内容?

    Image-Line News 汇总了 FL Cloud Pro 相关资讯,页面同时列出多条 FLEX 音色包、FL Studio 教程及产品更新。其中 FL Studio 2025 更新包含 500 条 Dynamic Mixer Tracks 和 Loop Starter,FL Cloud 页面则涉及 Sounds、AI-powered Mastering 与 Distribution。

3月10日周二
  1. Fish Speech67

    Fish Audio 发布 S2 Beta 预览版

    Fish Audio 发布 Fish Audio S2 Beta 预览版,采用基于 Qwen3 的 Dual-AR 架构,并结合 GRPO 强化学习对齐生成语音。

    推荐理由:提供 S2 Beta 的架构、推理、部署与微调变更清单,并列出模型参数、采样率、语言范围和流式性能指标,便于技术团队评估升级影响与部署条件。

1月9日周五
1月6日周二
  1. Gravy For The Brain29

    “Droids”到底是什么?Droids 与 Artificial Intelligence 有何区别

    文章借《星球大战》中的 Droids 类比 Artificial Intelligence,认为两者除名称外没有实质区别。Droids 是搭载程序的机器人形态,AI 可有实体,也可只是软件,本身不会思考或拥有通用智能。文章列举 AI Voice 在地图、语音助手、IVR、实时翻译和 TikTok 配音中的应用,但原文内容在讨论部分用途时截断。