英伟达推全新视觉AI语音模型可以直接看图聊天

发布时间：2024-11-15 18:51:36

如今AI大时代，英伟语音世界各大巨头都有自己的达推特色AI产品计划，日前据英伟达官方消息，全新英伟达联合 Georgia Tech、视觉UMD 和 HKPU 的模型研究团队推出了全新的视觉语言模型 ——NVEagle。

据悉，可直NVEagle 能够理解复杂的图聊天现实场景，通过视觉输入进行更好的英伟语音解读和回应。它的达推设计核心在于将图像转化为视觉标记，再与文本嵌入相结合，全新进而提升了对视觉信息的视觉理解。

NVEagle包括了三个版本:Eagle-X5-7B、模型Eagle-X5-13B 以及 Eagle-X5-13B-Chat。可直其中，图聊天7B 和13B 版本主要用于一般的英伟语音视觉语言任务，而13B-Chat 版本则专门针对对话式 AI 进行了微调，能够更好地进行基于视觉输入的互动。

NVEagle 的一个亮点在于采用了混合专家（MoE）机制，能够根据不同任务动态选择最合适的视觉编码器，这极大提升了对复杂视觉信息的处理能力。该模型已在 Hugging Face 上发布，方便研究人员和开发者使用。

英伟达推全新视觉AI语音模型可以直接看图聊天

推荐阅读

热门话题

英伟达推全新视觉AI语音模型 可以直接看图聊天