V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  retemlamb  ›  全部回复第 3 页 / 共 3 页
回复总数  58
1  2  3  
@12wk34 之前是这样,今年 2 月小红书团队的 FireRedASR2 AED 也很能打,对性能要求不高,嘈杂的音乐歌词的 CER 1.17% ,小红书团队说是工业级别模型,唯一的缺点是没有标点符号,需要搭配 FireRedPunc (小红书团队的文字断句和加标点模型) 使用,在模型设置里可以开启
@chendahui007 #24 soniox 看了一下是云端方案,效果确实不错。OpenASR 主打本地,定位不太一样(实际上像 Qwen / FireRed 系的模型在中文能力上还是不错的,FireRedASR2 LLM 的普通话 CER 可以达到 2.89%,恐怖如斯
@lel020 #27 也许你要找的是这个? https://github.com/xuyungit/VoiceX 支持 13 种不同的云服务,支持 Windows/macOS
@by9858 #25 好建议,目前 Windows 上模型默认存在用户目录下,确实会占 C 盘。自定义模型存储路径这个在设置-高级设置中有,后续我也会放到更醒目的位置
@yukminnie #23 断句确实是通病。目前接了 FireRed 的标点模型可以有很明显的改善(在 FireRedASR2 AED / Dolphin 的模型设置中启用),Qwen 系列的断句和标点也不错,后续也在看用 LLM 做转写后文本润色
@Leon6868 #20 确实,实时场景下说话人分割的飘逸和录音环境噪声是两个大问题。目前转写的分离效果还行,实时还在探索
@111111111111 不需要独立显卡,CPU 就能跑。你描述的情况像是音频采集没有正确传到引擎。麻烦打开设置 → 高级设置 → 日志目录,找到 daemon.log ,把最后 20 行贴在这里或者到 GitHub Issues 里提交一下,我帮你看看具体原因
@aoooo Windows 版用的是 Azure Trusted Signing 的代码签名证书,不是自签名。但因为是新项目下载量还不够,SmartScreen 信誉还没建立起来,所以会弹警告。已经跟微软反馈过了,下载量上去之后会自动消失。目前安装时点"更多信息"→"仍然运行"就行,代码本身是开源的可以随时审查

Microsoft:

The SmartScreen warning that you reported indicates that the application and/or certificate used to sign it do not yet have a reputation established in our system. Applications without a known reputation will show warnings when downloaded or installed. This does not prevent users from still clicking through to download or run the application. To do so, they can select "More info" -> "Run anyway" option within SmartScreen prompt window.

Reputation is established by how your download is used by Windows, Edge, Internet Explorer users and the SmartScreen® Service intelligence algorithms. Downloads are assigned a reputation rating based on many criteria, such as download traffic, download history, past anti-virus results and URL reputation.  This reputation may be based on the downloaded program or can also be assigned to the publisher, based on digital certificate information.

Once your signing certificate has gained reputation in our system, all applications or releases signed with your certificate should have warn-free experience (assuming nothing happens to denigrate the reputation of the certificate, such as being used to sign malware).

Please note, unsigned files will have to establish reputation each time a new version is released.

Thank you for contacting Microsoft.
@Mithril Handy 确实不错,我们也参考了不少。它最近 0.9.0 刚加了 Nemotron 的流式支持。OpenASR 这边实时转写从一开始就做了,目前 X-ASR 支持边说边出字,体验上会更接近自然输入
@People11 刚试了一下,效果挺好的,在浏览器里运行还挺有意思的。Nemotron 这个模型我也在关注,后续看看能不能接进 OpenASR (之前主要在测试模型中文的效果,Nemotron 的这个模型 FLEURS CER 大概是 20 上下)
@kelvinaltajiin 刚好最近看了 AppTek 发的多口音英语长对话 benchmark ( https://arxiv.org/abs/2604.27543 ),129 小时真实呼叫中心数据,覆盖 14 种英语口音,比 LibriSpeech 更接近实际场景。

https://openasr.org/assets/accent-wer-table.png

目前 OpenASR 里 Parakeet TDT v3 和 Qwen3-ASR 1.7B 都已经接入了,各有强项:印度英语 Parakeet v3 WER 约 9.7% 更优,苏格兰英语 Qwen3-ASR 1.7B WER 约 11.1% 更稳。总体英语口音上推荐先试 Qwen3-ASR (平均分是目前最高的),追求速度低延迟可以用 Parakeet
@indexError Win10 双击没反应的话,你下的应该是 GitHub 上的 CLI 版本,那个是命令行工具。桌面端安装包在官网 openasr.org 可以下,装完直接双击用。

![Dolphin 模型详情]( https://openasr.org/assets/openasr-desktop-dolphin-zh.png)

方言这块目前接了 Dolphin ( 22 种方言)和 FireRedASR2 AED-L (中文方言准确率很高),普通配置的电脑都能流畅跑( FireRedASR2 LLM 也接入了,但是太占用内存了)。大部分模型也支持热词,可以针对特定术语或人名做纠正。方言转普通话文本这个方向确实是刚需,最终解法可能还是要靠方言微调,这块我也在探索中
@DICK23 SpeechTranscriber 我也在关注,macOS/iOS 26 上中文确实差点意思,27 beta 上英文提升很明显,后续得看 Apple 会不会给中文换更强的语言模型。目前本地中文场景 OpenASR 接的几个模型体验会好不少,欢迎对比试试( iOS 版也在开发中,近期会上线
@zshwdt22023 中英混杂确实是 SenseVoice 的短板,这个场景推荐试试 X-ASR 或者 Qwen3-ASR ,体感好不少。测试对比这块确实该补上,我后面整理一份不同场景下的实测结果出来
@Leon6868 录音/会议转写的说话人分离已经支持了,预计本周上线 desktop 。实时字幕的说话人分离还在探索中,延迟和稳定性还没达到我满意的程度
@bearqq 看了下这个项目,都是基于 ggml 的方向,不过定位不太一样。audio.cpp 覆盖面更广( TTS 、语音转换、音乐生成都做),偏开发者框架; OpenASR 专注在 ASR 这一块,目标是让普通用户也能直接用起来。底层有一些可以互相参考的地方
@manhere 说话人识别确实是刚需。目前 cli 已经接了 pyannote segmentation 做说话人切换检测,加 wespeaker 做声纹聚类,--diarize 一个参数就能开。desktop 上这块还在打磨中
@tangseng233 感谢推荐,这个之前没关注过。转写 + 说话人分离正好是后面想补的方向,我研究一下看能不能适配进来
1  2  3  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3516 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 04:39 · PVG 12:39 · LAX 21:39 · JFK 00:39
♥ Do have faith in what you're doing.