AK:Audio8 ASR 是一个无限流语音识别模型,它采用原生流…


Audio8 ASR 是一个无限流语音识别模型,它采用原生流式架构,每秒解码12.5次。它使用滚动的KV缓存,即使在全天候运行的情况下也能保持内存和延迟的稳定。每时钟步长生成一个文本标记(相当于每秒12.5 / 8.3 / 6.25次决策)

Audio8 ASR 是一个无限流语音识别模型,它采用原生流式架构,每秒解码12.5次。它使用滚动的KV缓存,即使在全天候运行的情况下也能保持内存和延迟的稳定。每时钟步长生成一个文本标记(相当于每秒12.5 / 8.3 / 6.25次决策),平衡感知粒度和资源成本。一个实习生在HuggingChat中设置了一个Gradio工作流来尝试这个模型:HuggingChat模型:

—— AK (@_akhaliq) X帖子|2026-09-30T03:32:55+00:00
原帖:https://x.com/_akhaliq/status/2105138799147982883



扫描二维码,在手机上阅读

X榜单(2026年09月30日 12:00 北京时间)

腾讯、字节、阿里集体攻入个人AI助理

评 论
评论已关闭