英伟达近日开源了其最新大语言模型Nemotron-340B,该模型在多项基准测试中表现优异,性能超越Meta的Llama-3.1-405B。Nemotron-340B采用混合专家架构,拥有340亿参数,支持8K上下文长度,在推理、编程和数学任务上均展现出领先水平。

该模型基于英伟达的NeMo框架训练,使用了超过15万亿个token的数据集。英伟达表示,Nemotron-340B在MMLU、HumanEval和GSM8K等测试中分别取得了85.2%、82.1%和91.5%的准确率,显著高于Llama-3.1-405B。此外,Nemotron-340B在长文本理解和代码生成方面也表现出色。

英伟达此次开源Nemotron-340B,旨在推动大语言模型领域的创新,并为企业用户提供更高效、更强大的AI解决方案。开发者可通过Hugging Face平台获取模型权重和代码。