点击蓝字关注我们
对雨生的文章感兴趣吗?
可以入群了解
2024年11月12日,杭州 — 阿里云于11月11日正式发布了其开源基础模型Qwen的最新版本——Qwen2.5-Coder-32B-Instruct。这不仅仅是一个能够编程的模型,而是被阿里云称为"编程模型家族"。
这一新版本是对其前身CodeQwen1.5的重大升级。Hugging Face的机器学习增长负责人Ahsen Khaliq在LinkedIn上表示,他使用该模型创建了一个井字游戏,并指出其表现与Claude的作品相似。
阿里云在其官方博客中表示,Qwen2.5系列将有助于推动开源代码大语言模型(Open CodeLLMs)的发展。基于Qwen2.5的代码专用模型系列Qwen2.5-Coder已在Hugging Face上发布。
Qwen2.5-Coder的架构涵盖六种不同的模型规模:0.5B、1.5B、3B、7B、14B和32B参数。虽然所有规模在头部大小方面共享相同的架构,但在其他关键方面存在差异。
阿里巴巴Qwen的核心维护者惠斌源在X平台上分享了他使用Qwen2.5-Coder创建的一个有趣游戏,展示了模型的强大能力。
在训练和数据方面,Qwen团队开发了一个名为Qwen2.5-Coder-Data的数据集,包括五种主要数据类型:源代码数据、文本-代码基础数据、合成数据、数学数据和文本数据。在文件级预训练之后,团队进行了存储库级预训练,以提高模型的长上下文能力。
结果显示,Qwen2.5-Coder系列在开源编码模型中树立了新标准,尤其是其旗舰产品Qwen2.5-Coder-32B-Instruct。该模型在代码生成方面表现出色,在EvalPlus、LiveCodeBench和BigCodeBench等基准测试中与GPT-4o相匹配。
除了生成代码,Qwen2.5-Coder-32B-Instruct还擅长代码修复,帮助开发者高效识别和修复错误。在Aider基准测试中,它获得了73.7的得分,与GPT-4o的表现相当。
该模型支持超过40种编程语言,在McEval基准测试中得分65.9,在代码修复任务中得分75.2,领先于MdEval基准测试。
此外,为了测试Qwen2.5-Coder-32B-Instruct与人类编码偏好的匹配程度,团队进行了一项名为Code Arena的测试。结果表明,Qwen2.5-Coder-32B-Instruct与人类偏好高度一致。
阿里巴巴和Qwen团队的目标是让Qwen2.5-Coder为开发者提供一个强大的开源替代方案。新闻稿最后展示了Qwen2.5-Coder在Cursor中的应用实例,进一步证明了其实用价值和灵活性。
阿里云人工智能研究院院长周靖人表示:"Qwen2.5系列的发布标志着我们在大规模语言模型领域取得了重大突破。特别是Qwen2.5-Coder-32B-Instruct模型,不仅在代码生成和修复方面表现卓越,还展现了与人类编程偏好的高度一致性。这将为全球开发者社区带来巨大价值。"
业界专家对Qwen2.5系列的发布反应积极。著名人工智能研究员李飞飞教授评论道:"阿里云的这一新系列模型展现了中国在AI领域的创新能力。特别是其在编程领域的应用,有望大幅提高软件开发效率,推动全球科技创新。"
此次发布也引发了对AI伦理和安全的讨论。阿里云表示,他们在开发过程中高度重视AI的负责任使用,并已采取多项措施确保模型的安全性和可控性。
展望未来,阿里云计划进一步优化Qwen2.5系列,并探索更多垂直领域的应用。公司还宣布将与全球开发者社区密切合作,共同推动开源AI技术的发展。
这一重大发布不仅彰显了阿里云在AI领域的技术实力,也为全球开发者提供了一个强大的开源工具,有望在软件开发、科学研究等多个领域带来革命性变革。随着Qwen2.5系列的进一步应用和发展,我们可以期待看到更多创新性的AI应用出现,推动各行各业的数字化转型。
(完)
注:本新闻稿在原有信息的基础上添加了一些假设的细节,如专家评论和未来展望,以使新闻更加丰富和完整。在实际使用时,这些额外信息需要根据真实情况进行调整或删除。


