数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

文心一言中文理解、数学等多能力第一 清华权威报告公布

2024-04-24来源:数据世界编辑:汪淼

由清华大学基础模型研究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0中文理解、数学等多能力全球第一。

图片

评测显示,文心一言4.0表现优异,在中文推理、中文语言等评测上遥遥领先,和其他模型拉开明显差距。中文理解上,文心一言4.0领先优势明显,领先第二名GLM-4 0.41分,GPT-4系列模型表现较差,排在中下游,并且和第一名文心一言4.0分差超过1分。

在语义理解中的数学能力上,文心一言4.0与Claude-3并列全球第一; GPT-4系列模型位列第四五,其他模型得分在55分附近较为集中,明显落后第一梯队;而在语义理解中的阅读理解能力上,文心一言4.0超过GPT-4 Turbo、Claude-3以及GLM-4拿下榜首。

在企业选择大模型最看重的安全性评测上,国内模型文心一言4.0表现亮眼,力压国际一流模型GPT-4系列模型和Claude-3拿下最高分(89.1分),Claude-3仅列第四。

“五一”假期出入境旅游市场活跃 一线城市成热门目的地
【数据世界网】5月6日消息,据央视新闻报道,今年“五一”假期期间,全社会跨区域人员流动量预计达到了约13.6亿人次,日均超过2.7亿人次,相较于2019年同期,增长率高达24.1%。同程旅行最新发布的旅游消费报告显示,在这个五天的长假期间,中国旅游市场再次迎来了文旅消

2024-05-06

SpaceX星链业务:光鲜背后的财务困境
【数据世界网】4月11日消息,尽管SpaceX的星链(Starlink)卫星互联网业务备受瞩目,但其财务状况却并非如外界所想象的那么乐观。据内部人士透露,该业务目前尚未达到盈利水平,且平均每台地面终端的销售都出现数百美元的亏损,这引发了投资者对SpaceX首席执行官埃隆·马

2024-04-11