兴中资讯

热点

阿里云通义千问Qwen2.5-Max登顶AI大模型榜单

时间:2025-02-06 22:16

  阿里云近日公布了其全新的通义千问Qwen 2.5-Max超大规模MoE模型,并宣布在多个基准测试中超越DeepSeek V3等竞争对手。阿里云表示,Qwen2.5-Max在Chatbot Arena大模型盲测中,以1332分位列全球第七名,成为非推理类的中国大模型冠军。

  Qwen2.5-Max在数学和编程等单项能力上排名第一,在硬提示(Hard prompts)方面排名第二。这一成绩展示了阿里云在AI技术领域的领先地位。

  据公开资料显示,Chatbot Arena是由LMSYS Org推出的大模型性能测试平台,目前集成了190多种模型。该榜单采用匿名方式将大模型两两组队,交给用户进行盲测,用户根据真实对话体验对模型能力进行投票。因此,Chatbot Arena LLM Leaderboard成为业界公认的最公正、最权威榜单之一,也是全球顶级大模型的最重要竞技场。

  阿里云表示,在Arena-Hard、LiveBench、LiveCodeBench、GPQA-Diamond及MMLU-Pro等主流基准测试中,Qwen2.5-Max比肩Claude-3.5-Sonnet,并几乎全面超越了GPT-4o、DeepSeek-V3及Llama-3.1-405B。