跳到正文

#AI 音频

今日 1 条
今天10月3日周六
  1. OpenUtau 官方发布78

    OpenUtau 发布 0.1.571 Beta,新增表达式图与内置重采样器

    OpenUtau 发布 0.1.571 Beta,加入表达式图、内置 hifisampler、Worldline-R1.1、轨道效果 UI 和 DAW 集成 API。版本还新增歌手搜索、曲线编辑与移调、节拍器和 .m4a 导入,并优化后台处理、缓存、Linux 与 macOS 支持及多项错误修复。

    推荐理由:本次 Beta 更新扩展了表达式图、内置重采样器、轨道效果与 DAW 集成,并集中修复稳定性和兼容性问题,对歌声合成编辑流程影响明确。

10月2日周五
  1. Csound 官方发布84

    Csound 7.0.0-beta.18 发布,新增 WASM 调试支持并修复大量问题

    Csound 发布 7.0.0-beta.18,新增 WASM 调试器的逐控制周期回调支持、CS_VARIABLE 软件总线,并加入非阻塞 readline opcode 与宿主文本输入 API。版本同时修复数组、结构、UDO、实时线程、FFT、滤波、MIDI、SoundFont、GEN 系列及 WASM 麦克风输入等问题,并更新 iOS 示例。

    推荐理由:本次 beta 版本集中更新 WASM 调试与输入支持,并修复大量数组、结构、实时处理、FFT、滤波及声音文件问题,直接影响 Csound 开发、插件维护与跨平台部署的稳定性。

10月1日周四
  1. Castos Blog67

    Castos 为播客 RSS feed 增加 WebVTT 转写文件支持

    Castos 现在会通过 RSS feed 将 AI 转写转换为带时间戳的 .vtt 文件,并添加到新节目及已有转写节目。创作者也可在单集编辑器上传 .vtt 文件,支持 Apple Podcasts 等读取 Podcasting 2.0 <podcast:transcript> 标签的播客应用显示字幕;文件上限为 2 MB,必须以 WEBVTT 开头并包含至少一条带时间的字幕。

    推荐理由:Castos 将 AI 转写和手动上传的 WebVTT 字幕统一接入 RSS feed,能直接改善 Apple Podcasts 等支持 Podcasting 2.0 的客户端显示,也明确了文件要求、替换方式与订阅权限。

9月29日周二
9月25日周五
  1. DTM Station83

    MOTU Digital Performer 12 实测:新增 Dolby Atmos、AI 声部分离与 MusicXML

    MOTU 的 Digital Performer 12 于9月18日推出,新增 Dolby Atmos 沉浸式混音、AI 声部分离和 MusicXML 导入导出。

    推荐理由:文章实测了六类 AI 声部分离及 MusicXML 对歌声合成器与乐器的联动,并梳理 Atmos、编曲工具、授权价格与系统要求,能为升级和跨软件工作流决策提供直接依据。

9月11日周五
  1. whisper.cpp 官方发布73

    whisper.cpp 发布 v1.9.4

    whisper.cpp v1.9.4 已发布,Nightly build 为 b5130。更新调整了语言自动检测与解码器状态管理,使服务端在检测响应中返回语言,并修复 whisper_mel 未初始化读取和空输入等问题。版本还增加 Windows On ARM 发布支持、更新 OpenVINO 模型转换与文档,并调整多个后端和 CI 配置。

    推荐理由:此次发布补强语言检测与服务端响应,并修复重复调用、缓存和输入读取问题,同时更新 OpenVINO 支持及多平台构建配置,对语音识别部署与维护有直接参考价值。

9月6日周日
  1. sherpa-onnx 官方发布74

    sherpa-onnx v1.13.7 发布更新多平台与语音识别功能

    sherpa-onnx v1.13.7 修复 iOS、Windows arm64、CI 构建及在线标点模型初始化问题,并新增 Rust 的 iOS 支持、hello world Tauri 示例和 JavaScript API 的批量解码。

    推荐理由:本次更新覆盖多平台构建、Rust 与 JavaScript API、流式识别及模型兼容性,能帮助使用者评估跨平台部署与识别接口调整带来的工程影响。

9月5日周六
  1. Piper TTS67

    Piper 发布 v1.8.0,新增基于 TLTK 的泰语 phonemizer

    Piper v1.8.0 新增基于 TLTK 的泰语 phonemizer,训练时可使用 th extra --data.phoneme_type thai,合成时可在 voice config 中设置 "phoneme_type": "thai"。

    推荐理由:新增基于 TLTK 的泰语 phonemizer,明确训练配置、语音配置及 IPA warmstart 兼容性,并同步补充安装脚本与 CI 测试,能直接影响泰语 TTS 的训练和合成流程。

8月19日周三
  1. Kokoro ONNX 官方发布68

    Kokoro ONNX 发布 model-files-v1.1 模型文件

    Kokoro ONNX 发布 model-files-v1.1,提供 Kokoro v1.0 与 v1.1-zh 的全精度、FP16 和 INT8 ONNX 文件,以及对应语音包。

    推荐理由:三种精度文件及体积、相关性和语音包信息便于部署选择;时长输出、浮点速度输入与图内嵌配置还能直接改善时间戳生成、变速稳定性及分发完整性。

8月18日周二
8月11日周二
  1. sherpa-onnx 官方发布76

    sherpa-onnx 发布 v1.13.5 更新模型、运行时与多平台支持

    sherpa-onnx 发布 v1.13.5,更新 Nemotron、Moonshine、Inflect 等模型支持,并改进 QNN、WebAssembly、SPM、Flutter 和多平台构建。此次版本还修复 ScaleSilence、Piper TTS、Paraformer、FireRedASR、Pyannote 及多项崩溃、内存和数值计算问题。

    推荐理由:本次更新覆盖模型导出、QNN 与多平台运行时,并集中修复 ASR、TTS、VAD 和音频处理中的稳定性与兼容性问题,对部署和制作流程有直接参考价值。

8月7日周五
  1. sherpa-onnx 官方发布73

    sherpa-onnx 发布 v1.13.4,新增 QNN 支持并修复 Windows 路径问题

    sherpa-onnx 发布 v1.13.4,导出 Parakeet、Whisper 和 nemotron-speech-streaming-en-0.6b 等模型至 QNN,并加入对应 C++ 运行时支持。

    推荐理由:本次更新覆盖 QNN 模型导出与 C++ 运行时、Windows 路径兼容和 ASR 结果处理,并扩展 JavaScript 非流式 API 的逐流热词支持,对部署与语音识别集成有直接参考价值。

8月4日周二
  1. whisper.cpp 官方发布64

    whisper.cpp 发布 v1.9.2,更新 VAD 与 CJK 支持

    whisper.cpp 发布 v1.9.2,改进了 VAD 语音分段、时间戳映射和参数解析,并使 voice_length() 支持 UTF-8 CJK。版本还涉及 Parakeet、Android 示例推理性能、Ruby 语音分段 API 及 Nix 构建修复。

    推荐理由:本次更新覆盖 VAD、CJK 文本处理、Android 推理性能与构建兼容性,并新增 Ruby 的语音分段 API,对语音识别工具的集成和部署维护具有直接参考价值。

7月23日周四
6月26日周五
6月19日周五
  1. whisper.cpp 官方发布35

    whisper.cpp 发布 v1.9.1

    whisper.cpp 发布 v1.9.1 版本,由 danbev 提交。此次版本在 Windows BLAS 的持续集成配置中新增 GGML_NATIVE=OFF 和 GGML_BMI2=OFF,并包含从 v1.9.0 到 v1.9.1 的完整变更记录。

6月17日周三
4月30日周四
  1. Steinberg Blog66

    Dorico 6.2.20 发布并支持 Cantai 人声合成插件

    Steinberg 发布 Dorico 6.2.20,为 Dorico Pro 6、Dorico Elements 6 和 Dorico SE 6 增加对 Cantai 人声合成 VST 插件的支持。Cantai 可通过播放模板或手动添加到 Dorico,并为指定乐器自动渲染、更新人声部分;该更新还包含 25 项以上修复,包括 iPad 项目名称含逗号时无法打开的问题。

    推荐理由:本次更新明确了 Cantai 在 Dorico 6 中的加载、分配与渲染流程,并补充了兼容问题和编辑功能修复,对人声合成与谱曲工作流具有直接配置价值。

4月11日周六
  1. Decent Samples66

    Decent Sampler 1.20.0 新增波表引擎

    Decent Sampler 1.20.0 新增波表引擎,可通过扫描单周期波形帧并交叉淡化来生成复杂、变化的音色。当前支持波形类型、文件路径、位置与帧插值四项参数,其中位置可实时调制;文件格式基于 Serum 兼容的 RIFF WAV。

    推荐理由:明确说明新增引擎的参数、绑定层级与文件格式,能帮助采样乐器开发者配置可实时调制且支持帧插值的波表音色。

3月11日周三
  1. Image-Line News23

    FL Cloud Pro 有哪些新内容?

    Image-Line News 汇总了 FL Cloud Pro 相关资讯,页面同时列出多条 FLEX 音色包、FL Studio 教程及产品更新。其中 FL Studio 2025 更新包含 500 条 Dynamic Mixer Tracks 和 Loop Starter,FL Cloud 页面则涉及 Sounds、AI-powered Mastering 与 Distribution。

12月10日周三
  1. Image-Line News28

    FL Cloud Pro 有哪些新内容?

    FL Cloud Pro 相关页面汇集 FLEX 音色包、FL Studio 学习与教程,以及 Sounds、AI-powered Mastering 和 Distribution 等内容。页面还列出已发布的 FL Studio 2025,包含 500 条动态混音轨、Loop Starter 等新功能。

9月15日周一
  1. plugdata 官方发布73

    plugdata 发布 v0.9.2-test3 最终候选版本

    plugdata 发布 v0.9.2 的最终候选版本 v0.9.2-test3,修复了 FFT、Lua、关闭过程及多项 DAW 与插件问题,并改进渲染性能和资源体积。版本引入 Heavy 对带空格路径的支持、插件商店、实验性 Gem 支持、多项工作流改进及 OWL、WASM Heavy 导出平台,同时包含 [knob] 破坏性变更。

    推荐理由:作为 v0.9.2 的最终候选版本,发布内容覆盖稳定性、渲染性能、资源体积与平台支持,并明确标注破坏性变更,适合升级前评估兼容风险与制作流程影响。