上海人工智能实验室(上海AI实验室)近日发布了InternLM2系列大模型的技术报告,并已在GitHub开源。报告显示,InternLM2在多个基准测试中表现优异,性能超越了Meta的Llama-3-8B模型,尤其在数学推理和代码生成任务上优势明显。

InternLM2采用了创新的混合注意力机制和动态批处理策略,在保持高效推理的同时提升了模型容量。该模型支持长文本处理,上下文窗口可达32K tokens。目前,InternLM2已开放多个尺寸版本,包括1.8B、7B和20B参数,供开发者下载使用。

上海AI实验室表示,InternLM2的完整训练细节和代码均已公开,旨在推动大模型技术的开源生态发展。这一成果也标志着国产大模型在性能上进一步缩小了与国际先进水平的差距。