Skip to content

Latest commit

 

History

History
69 lines (55 loc) · 17.4 KB

File metadata and controls

69 lines (55 loc) · 17.4 KB

English | 简体中文

FunASR 社区集成

本页收录已经在上游项目中落地、仍在维护的 FunASR、Fun-ASR-Nano、SenseVoice 或其他官方 FunASR 模型集成。下面每一项都已对照项目默认分支核验;如有对应的已合并 PR,文中也提供了链接。

这些集成由社区项目维护,其发布节奏、硬件支持和 API 稳定性由上游项目决定,不属于 FunASR 维护者的兼容性承诺。

语音 Agent 与应用

项目 已集成能力 从这里开始
recording-inbox 面向飞书/Lark 录音归档的自托管工作流,在 macOS 或 Windows 本地运行 SenseVoiceSmall,再把结构化会议纪要和带时间戳全文发布回飞书。可恢复流水线已用于多小时录音,并有真实纯 CPU 推理验证和跨平台 mocked CI。 项目指南macOS 安装 和 FunASR showcase #3294
Pipecat 面向语音和多模态 Agent pipeline 的本地 FunASRSTTService,底层使用 SenseVoice,并提供转写与语音 Agent 示例。 FunASR 服务文档转写示例语音 Agent 示例 和已合并 #4844
xiaozhi-esp32-server 默认本地 ASR provider 使用 FunASR + SenseVoiceSmall;识别语种可设为 autozhenjakoyue,同时也提供独立 FunASR runtime server provider。 Provider 实现配置 和已合并 #3255
AutoSubs 面向 DaVinci Resolve、Premiere 和 After Effects 字幕生成的端侧 int8 ONNX SenseVoice 引擎。 SenseVoice 模型说明引擎源码 和已合并 #629
TMSpeech Windows 会议字幕与翻译工具,可通过外部命令识别器运行 Fun-ASR-Nano INT8。Silero VAD 先完成语音段切分再调用 Nano 解码,同时保留原有低成本 C# 流式识别器。 Fun-ASR-Nano 配置识别器源码 和已合并 #110
clowder-ai 本地 AI 服务启动器;whisper-stt 服务位现在包含 Qwen3-ASR 作为 backend model variant,让本地 ASR 安装入口保持可见,同时不再新增一个独立语音服务。 服务 manifest推荐矩阵 和已合并 #1083
蛐蛐 / QuQu 中文桌面语音转文字工作流,也是 Wispr Flow 的开源替代方案;内置本地 FunASR Paraformer pipeline、funasr_server.py、VAD、标点恢复,并可接入 LLM 文本优化。 项目 READMEFunASR serverpackage metadata
OpenLess macOS 与 Windows 开源语音输入应用;统一 Bailian ASR provider 暴露 Fun-ASR-Flash 录音文件转写,并与实时 ASR 选项一起服务于光标听写和 AI prompt 工作流。 项目 READMEDashScope multimodal ASR providerprovider settings copy 和已合并 #793
OmniVoice Studio 本地语音克隆、配音、听写和有声书应用;既可通过 OpenAI 兼容远程 ASR backend 连接自托管 FunASR/SenseVoice 服务,也提供原生 FunASR/SenseVoice + CAM++ 路径,让整段录音里的 speaker identity 保持一致。 OpenAI 兼容 ASR 指南FunASR backend、已合并 #1003 和已合并 #1167
GPT-SoVITS 使用 Fun-ASR-Nano、SenseVoice 和经典 FunASR 模型完成数据集预处理与 WebUI 转写。 funasr_asr.py、runtime fallback #2801 和 backend 文档 #2803
AudioNotes 将音视频内容提取为结构化 Markdown 笔记,并把 Fun-ASR-MLT-Nano 路由到 Fun-ASR Nano 推理配置,保留 cache、batch size 和列表式 hotwords。 项目 READMEFunASR 服务 和已合并 #65
Stet macOS 本地听写应用,内置 in-process Fun-ASR Nano 引擎;其 universal static runtime 源自 FunASR llama.cpp 路径,并通过 Settings 管理 encoder、decoder、VAD 下载,支持 runtime 复用和个人词典 hotwords。 FunASR package 说明Fun-ASR Nano spec 和已合并 release #44
NarratoAI AI 视频解说与剪辑应用,可通过 OpenAI 兼容转写 endpoint,把字幕生成连接到自托管 FunASR 服务。 FunASR 字幕服务配置示例 和已合并 #259
wyoming-faster-whisper Wyoming 协议 speech-to-text server,提供可选 FunASR backend,让本地语音助手和 Home Assistant 相关部署可以通过 Wyoming 使用 SenseVoice/FunASR。 FunASR handler模型注册 和已合并 #95
Dify official plugins 面向自托管 FunASR endpoint 的 Dify 官方 speech-to-text 模型 provider,内置 SenseVoice、Fun-ASR-Nano、Paraformer 和 Paraformer English 配置。 FunASR 插件 READMEprovider 实现speech-to-text adapter 和已合并 #3281
RAGFlow RAG 与 Agent 平台,提供本地 FunASR / SenseVoice speech-to-text provider,适合自托管文档和媒体摄取工作流;同时可通过 Tongyi-Qianwen provider 使用托管 Fun-ASR-Flash speech-to-text。 Provider 注册支持模型文档、已合并 #16473 和已合并 #16844
LiveTalking 实时交互数字人服务,包含本地 FunASR/SenseVoice ASR server 路径;已合并修复会串行化共享模型访问,避免并发请求在懒加载模型或 generate() 时竞争。 ASR server项目 README 和已合并 #611
Sokuji 实时语音翻译应用,本地推理 sidecar 支持通过 FunASR 使用 GPU-native SenseVoice,并在内置模型目录中提供离线 CPU/GPU Fun-ASR-Nano 与 Fun-ASR-MLT-Nano ASR。 Sidecar 模型目录native model catalog、已合并 #268、已合并 #270 和已合并 #329
VocaLinux Linux 离线语音输入应用,可通过 remote ASR engine 连接自托管 FunASR 或 SenseVoice OpenAI 兼容 endpoint。 Remote ASR 指南recognition manager 和已合并 #468
TranscriptionSuite 本地私有 speech-to-text 桌面/server 应用,提供 SenseVoice/FunASR backend、OpenAI 兼容音频路由和 CAM++ 说话人分离支持。 SenseVoice backendOpenAI audio route、已合并 #198 和已合并 #201

模型服务与 Runtime

项目 已集成能力 从这里开始
Xinference 通过 Xinference 统一推理 API 提供 SenseVoiceSmall、Fun-ASR-Nano-2512 和 Fun-ASR-MLT-Nano-2512 内置音频模型规格。 音频模型规格 和已合并 #5140 中的 FunASR 1.3 兼容性更新。
Optimum Intel 通过 Hugging Face Optimum Intel 支持 Fun-ASR 模型的 OpenVINO 导出与推理,包括 FunASR 专用 modeling 代码以及 ASR、export、quantization 覆盖。 FunASR OpenVINO modeling支持模型文档 和已合并 #1801
OpenVINO Notebooks OpenVINO 官方 FunASR-Nano 教程资料,包含 helper 代码和 NPU device 修复,方便用户在 Intel 加速路径上运行 notebook。 FunASR-Nano notebookOpenVINO FunASR helper、已合并 #3497 和 NPU 修复 #3517
SGLang Omni 面向 omni models 的 multi-stage pipeline runtime,已内置 Fun-ASR 模型支持、OpenAI 兼容服务、cookbook 文档、benchmark 任务和格式化后的 stream-output 测试。 Fun-ASR cookbookFun-ASR 模型 runtime、已合并 #1078 和 review-fix 已合并 #1079
Fun-ASR-vLLM 面向 Fun-ASR-Nano 和 Fun-ASR-MLT-Nano 的社区 vLLM 推理实现,包含批量评测和 NVIDIA Triton 部署。 安装与 Benchmark 和已合并 #20 中的确定性 ASR 解码修复。
vad-burn 纯 Rust FSMN VAD 推理与 Python binding,支持离线、流式和纯 CPU 模式。 项目 README 和 FunASR showcase #3106

发现入口

项目 已集成能力 从这里开始
awesome-python SenseVoice 已收录到大型 Python 资源目录的 Speech Recognition 部分,方便 Python 开发者发现本地多语种 ASR。 项目 README 和已合并 #3246
speech-trident SenseVoice 已收录到 speech/audio language models 目录,面向语音 LLM、representation learning 和 codec model 读者。 项目 README 和已合并 #31
voiceai 面向 Voice AI agent builder 的资源地图,在 Speech-to-text (STT / ASR) 部分同时收录 FunASR 和 SenseVoice,帮助开发者发现自托管本地 ASR 与多语种语音理解选项。 英文 README中文 README 和已合并 #16
Large-Audio-Models 面向音频领域 foundation model 的资源目录,已收录 FunAudioLLM 语音理解与生成论文及 SenseVoice 代码入口,方便语音、歌声和音乐模型读者发现项目。 项目 README 和已合并 #26
Neural-Codec-and-Speech-Language-Models 面向 neural codec、TTS 和 speech language model 的资源目录,已同时收录 Fun-ASR-Nano 与 SenseVoice,方便对比 ASR 和语音理解模型的读者发现项目。 项目 README 和已合并 #4

采用社区集成前

  • 按上游项目的安装和发布说明操作,不要假设其依赖版本与 FunASR main 完全一致。
  • 用计划部署的模型、语种、音频格式和硬件路径做一次真实验证。
  • 应用或 adapter 问题优先反馈给集成项目;可复现的 FunASR 核心模型或 runtime 问题反馈到 FunASR issues

收录你的项目

如果你维护了 FunASR 集成,请提交 showcase issue,并提供:

  • 仓库链接和维护状态
  • 支持的 FunASR 模型或 runtime 路径
  • 安装方式和最小使用示例
  • 已合并改动、正式发布、benchmark 或其他可复现验证
  • 官方、社区维护或实验性项目的明确说明