首页 > 科技周边 > 人工智能

智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一

来源：机器之心

时间：2024-06-19 13:54:45 164浏览收藏

编程并不是一个机械性的工作，而是需要有思考，有创新的工作，语法是固定的，但解决问题的思路则是依靠人的思维，这就需要我们坚持学习和更新自己的知识。今天golang学习网就整理分享《智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一》，文章讲解的知识点主要包括，如果你对科技周边方面的知识点感兴趣，就不要错过golang学习网，在这可以对大家的知识积累有所帮助，助力开发能力的提升。

FlagEval评测平台发布了最新榜单，其中6月中旬发布的“客观评测”中，GPT-4在闭源大模型中排名第一，Doubao-Pro（豆包大模型）排名第二，同时也是得分最高的国产大模型；其后依次是ERNIE 4.0、Baichuan3、Moonshot-v1等。在开放答案评测中，Doubao-Pro同样排名第二，得分超过GPT-4o和GPT-4。新技术的不断涌现，能够持续关注并适应新技术的平台才能在这个竞争激烈的市场中立于不败之地。字数：114

图：豆包大模型在 FlagEval 客观评测中获综合评分第二（2024年6月）

FlagEval 大模型评测平台由智源研究院与多个高校团队共建，以人类认知能力的发展阶梯为基准，对齐大模型所能达到的认知水平。FlagEval 构建了大量原创的非公开评测集，确保评测质量和公正性。自2023年6月上线以来，FlagEval 已完成了1000多次覆盖全球大模型的评测。

Doubao-Pro是一款由字节跳动自主研发的大语言模型，于5月15日正式发布。本期FlagEval大模型排行榜，豆包大模型在公开评测中的首次亮相便斩获亚军。该模型具有强大的序列生成和自然语言理解能力，可广泛应用于对话生成、文本摘要、机器翻译等多个领域。

在客观评测和主观评测中，显示豆包大模型的数学能力、知识运用、任务解决等多项能力在客观评测和主观评测中都有着出色表现。其中，知识运用和数学能力得分在客观评测第一、主观评测前三，任务解决得分在客观评测中均排名前三。

数学能力是评估大模型是否“聪明”的一个重要维度。此前，复旦大学自然语言处理实验室进行了一项针对2024年高考数学题目的13家主流大模型产品进行评测，豆包的数学高考新课标II卷答题获得最高分，客观题正确率达到74.66%，成绩优于GPT-4o及国内多款大模型产品。

智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一

图片来源：复旦NLP实验室公众号

豆包大模型是国内使用量最大、应用场景最丰富的大模型之一，日均处理 token 达到千亿级。其同名AI对话助手“豆包”，在苹果APP Store和各大安卓应用市场的AIGC类应用中下载量排名第一。目前，豆包大模型正在通过字节跳动向企业市场开放服务，已经与OPPO、荣耀、小米、三星、华硕等智能终端厂商建立合作。

今天带大家了解了的相关知识，希望对你有所帮助；关于科技周边的技术知识我们会一点点深入介绍，欢迎大家关注golang学习网公众号，一起学习编程~

产业

声明：本文转载于：机器之心如有侵犯，请联系study_golang@163.com删除