当前位置: 您当前的位置 : 科技金融网  ->  创新  -> 正文

中国大模型再迎高光时刻,又是来自杭州

2025年02月05日 17:47:36 来源:经济观察报、界面新闻 作者:

  DeepSeek大爆后,又一中国模型实现了对OpenAI的赶超。

  2月4日凌晨,三方基准测试平台Chatbot Arena公布了最新的大模型盲测榜单,包括阿里云在内的多家中国公司旗下大模型性能跻身前列。其中,一周前阿里云通义团队刚发布的Qwen2.5-Max超越DeepSeek V3、OpenAI o1-mini和Claude-3.5-Sonnet等模型,以1332分位列全球第七名,也是非推理类的中国大模型冠军。

  值得一提的是,不论是春节期间火爆全球的DeepSeek,还是此次迎头赶上的阿里云通义团队,两者都来自浙江杭州。

  据了解,Chatbot Arena是由LMSYS Org推出的大模型性能测试平台,目前集成了190多种模型。该榜单采用匿名方式将大模型两两组队,交给用户进行盲测,用户根据真实对话体验对模型能力进行投票。因此,Chatbot Arena LLM Leaderboard成为业界公认的最公正、最权威榜单之一,也是全球顶级大模型的最重要竞技场。

  ChatBot Arena官方评价称:阿里巴巴的Qwen2.5-Max在多个领域表现强劲,特别是专业技术向的(编程、数学、硬提示等)。

  Qwen2.5-Max是阿里云通义团队约一周前发布的最新MoE模型,展现出极强劲的性能。在Arena-Hard、LiveBench、LiveCodeBench、GPQA-Diamond及MMLU-Pro等主流基准测试中,Qwen2.5-Max比肩Claude-3.5-Sonnet,并几乎全面超越了GPT-4o、DeepSeek-V3及Llama-3.1-405B。

  Qwen2.5-Max发布后,立刻在海内外大模型社区引发热议:ChatBot Arena官方发推文称,以Qwen2.5-Max为代表的中国大模型正在迎头赶上;有从业者在惊叹新模型强大性能的同时,也兴奋地表示:“我们可以告别Chat GPT了!”

  目前,企业可在阿里云百炼调用Qwen2.5-Max模型的API服务,开发者也可在Qwen Chat平台中免费体验最新模型。

  在乙巳蛇年的春节假期里,中国大模型既有DeepSeek在海外市场走红的突出表现,也有阿里云在模型性能方面的突破创新。有市场分析观点表示,此前过度聚焦DeepSeek,却忽视了包括阿里通义在内的中国AI整体性追赶。

  国产大模型的崛起让更多人意识到,Open AI已不再是大模型领域的唯一主导者。正如Chatbot Arena官方评价:“以Qwen2.5-Max为代表的中国大模型正在迎头赶上。”而OpenAI首席执行官山姆·奥特曼曾在o3-mini推出后承认,中国AI的崛起削弱了OpenAI的技术领先优势。

[编辑: 王姝]
(本文来源:经济观察报、界面新闻)
  • 科技金融时报
举报电话:0571-87089618 | 地址:杭州市文一路115号 | 法律顾问:北京京师(杭州)律师事务所陈佳律师
互联网新闻信息服务许可证 33120240003 | 浙ICP备2024107310号 | 浙公网安备33010602013724
Copyright © 2014 kjjrw.com.cn. All rights reserved.