Cactus发布Whistle:16.9MB语音识别模型
Cactus Compute推出开源语音识别模型Whistle,仅5500万参数(激活3600万),CQ2bit量化后文件仅16.9MB,支持七种语言并覆盖17个平台。其在LibriSpeech test-clean上WER为4.31,优于145.3MB的Whisper base(4.9),旨在将AI压缩至廉价手机、可穿戴设备等小终端。
Whisper 是 OpenAI 发布的开源自动语音识别(ASR)模型系列,提供多种规模,广泛用于转录和语音翻译。近期报道多为其他开源 ASR 模型与 Whisper 的对比:Cactus 推出 16.9MB 的 Whistle,在 LibriSpeech test-clean 上 WER 为 4.31,对比 Whisper base 的 4.9;Lokutor 发布可在 ESP32-S3 上运行的 Oído,WER 为 3.7/8.2,对比 Whisper tiny.en 的 6.3/15.9;另有 macOS 本地照片和视频搜索工具使用 Whisper 进行对话搜索。
Cactus Compute推出开源语音识别模型Whistle,仅5500万参数(激活3600万),CQ2bit量化后文件仅16.9MB,支持七种语言并覆盖17个平台。其在LibriSpeech test-clean上WER为4.31,优于145.3MB的Whisper base(4.9),旨在将AI压缩至廉价手机、可穿戴设备等小终端。
一款面向macOS的AI搜索工具可对任意文件夹中的照片和视频逐帧进行语义搜索,支持OCR文字与Whisper语音台词检索,推理完全在本地运行,无需账户或上传云端。
Lokutor团队发布开源语音识别模型Oído,基于13M参数的NVIDIA Conformer-CTC Small int8量化版,可在8MB PSRAM的ESP32-S3上运行,无需GPU或NPU。LibriSpeech上WER为3.7/8.2,优于Whisper tiny.en的6.3/15.9。