阿里云通义千问Qwen2.5-Max登顶AI大模型榜单

时间：2025-02-06 22:16:10

　　阿里云近日公布了其全新的通义千问Qwen 2.5-Max超大规模MoE模型，并宣布在多个基准测试中超越DeepSeek V3等竞争对手。阿里云表示，Qwen2.5-Max在Chatbot Arena大模型盲测中，以1332分位列全球第七名，成为非推理类的中国大模型冠军。

　　Qwen2.5-Max在数学和编程等单项能力上排名第一，在硬提示（Hard prompts）方面排名第二。这一成绩展示了阿里云在AI技术领域的领先地位。

　　据公开资料显示，Chatbot Arena是由LMSYS Org推出的大模型性能测试平台，目前集成了190多种模型。该榜单采用匿名方式将大模型两两组队，交给用户进行盲测，用户根据真实对话体验对模型能力进行投票。因此，Chatbot Arena LLM Leaderboard成为业界公认的最公正、最权威榜单之一，也是全球顶级大模型的最重要竞技场。

　　阿里云表示，在Arena-Hard、LiveBench、LiveCodeBench、GPQA-Diamond及MMLU-Pro等主流基准测试中，Qwen2.5-Max比肩Claude-3.5-Sonnet，并几乎全面超越了GPT-4o、DeepSeek-V3及Llama-3.1-405B。

上一篇：｜关注“卖水人”，DeepSeek对投资的意义返回首页

下一篇：Quantinuum宣布生成式量子人工智能突破

热点推荐

1 OTC鲸鱼卖出29000枚ETH获利640万美元

OTC鲸鱼在5小时前卖出了29,000枚以太坊，价值约5310万美元，此前他在上周的市场回调中购入这些...

2 美国政府转移34.9万美元FTXAlameda查没资产

消息，据onchainlens监测，美国政府托管的FTX/Alameda破产案查没资金的地址转移了价值34.9万美元的...

3 向黎巴嫩南部地区的以色列部队发射火箭

消息，黎巴嫩真主党：向黎巴嫩南部地区的以色列部队发射火箭弹和炮弹，目前冲突仍在持续...

4 美加州州长称特朗普指示司法部对其展开

消息，美国加利福尼亚州州长纽森15日指责总统特朗普将他视为政治敌人，并指示司法部对其展...