Knowledge File / AI小生意项目库
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用
NVIDIA 开源了全双工语音对话模型 VoiceChat 11B,实现 448 毫秒轮换延迟,并首次支持对话中工具调用,但权重受研究用途限制,需 80GB 显存,目前无托管 API。
SOURCE / AI小生意项目库
MIN / 4
ACCESS / 会员
POST / 2026-08-10 07:58:34
原贴
查看原文原文
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。 AIHOT 分类:ai-models
中文翻译
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。
该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。
权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
核心信息
NVIDIA 开源了全双工语音对话模型 VoiceChat 11B,实现 448 毫秒轮换延迟,并首次支持对话中工具调用,但权重受研究用途限制,需 80GB 显存,目前无托管 API。
- NVIDIA 开源了全双工语音对话模型 VoiceChat 11B,实现 448 毫秒轮换延迟,并首次支持对话中工具调用,但权重受研究用途限制,需 80GB 显存,目前无托管 API。
- 原贴提到:NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮
- 来源:marktechpost.com
试看内容
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。
详细解读
信息差价值
参考来源
成为会员查看完整内容