百度文心大模型 4.0 爆料:万卡训练史上最大参数,最快下周见
创始人
2025-07-03 09:11:15
0

10 月 9 日消息,昨天,财联社爆料称百度的文心大模型 4.0 正在加紧训练,已经接近可发布状态。今天,IT之家也扒到了更多关于文心 4.0 的消息,涉及了底层架构、基础设施、训练数据集、成本等关键信息。

先说核心结论:

  • 1、昨天的爆料基本属实。目前了解到,文心大模型 4.0 实际上已经在小流量测试。
  • 2、文心 4.0 参数量大于所有已公开发布参数的 LLM,也是国内首次使用万卡集群训练的大模型。
  • 3、推理成本相比文心 3.5 增加很多,据传大概是 8-10 倍。(大模型真的很费钱)

接下来我们看看爆料的细节。

万卡集群训练的史上最大参数模型?

根据IT之家拿到的消息,文心大模型 4.0 的参数规模要大于目前所有公开发布参数的 LLM,这意味着文心大模型 4.0 的参数规模预计能突破万亿级别。

单看这个参数量,很多人会觉得还好,毕竟根据目前揭秘的信息,GPT-4 的参数量已经在 1.8 万亿左右。但爆料人进一步表示,文心大模型 4.0 仍然是一个单一模型,并没有采用 GPT 和很多其他大语言模型使用的混合专家模型(MoE)。

之前“天才黑客”乔治・霍兹就爆料,GPT-4 之所以采用混合模型,是因为无法让模型的参数规模超过 2200 亿。OpenAI 希望模型变得更好,但如果仅仅是训练时间更长,效果已经递减。

所以,如果百度能实现单一模型上的突破,模型能力是否也会有明显的提升,这个只能等真正发布之后来看了。

这么大参数量的模型,对算力要求注定不会小。现在的消息是,文心 4.0 是在万卡 AI 集群上训练出来的,应该也算上是国内首次使用万卡规模集群进行训练的大语言模型。

万卡集群什么概念,国内目前只有华为、阿里透露已建成万卡 AI 集群,但我们都没看到基于它推出的具体模型。

这说明,万卡集群就不容易建了,如果用起来发挥最大化作用则更难了。据分析正是因为飞桨的深度联合,才能基于万卡集群训练起如此规模的模型。

成本激增,已低调面向公众小流量测试

不仅训练成本在增加,文心 4.0 的推理成本也被爆比 3.5 增加很多,IT之家还没拿到具体每千 token 的推理成本,但据传大概是此前的 8-10 倍,这还是在高利用率(MFU)的情况下。如果利用率更低,估计成本还会继续增加。

最后,根据内部员工的说法,百度实际上已经开始秘密小流量测试文心大模型 4.0,有小部分文心一言用户在使用的已经是最新的模型版本,最快下周就会官方公布。

不少人认为这个说法比较靠谱,也可以从最近技术社区上的一些爆料上看出一点端倪。说不定,你现在在文心一言上提问,用的就是文心大模型 4.0 了。不知道生成的结果是否能跟 GPT-4 一战。

IT之家再次强调,以上并非官方确认的信息,大家自行判断其准确性。

相关内容

热门资讯

PHP新手之PHP入门 PHP是一种易于学习和使用的服务器端脚本语言。只需要很少的编程知识你就能使用PHP建立一个真正交互的...
网络中立的未来 网络中立性是什... 《牛津词典》中对“网络中立”的解释是“电信运营商应秉持的一种原则,即不考虑来源地提供所有内容和应用的...
各种千兆交换机的数据接口类型详... 千兆交换机有很多值得学习的地方,这里我们主要介绍各种千兆交换机的数据接口类型,作为局域网的主要连接设...
粉嫩如何诠释霸道 东芝M805... “霸道粉”是个什么玩意东芝M805拿过来的时候,笔者扑哧笑了,不是笑这款笔记本,而是笑这款产品的颜色...
什么是大数据安全 什么是大数据... 在《为什么需要大数据安全分析》一文中,我们已经阐述了一个重要观点,即:安全要素信息呈现出大数据的特征...
如何利用交换机和端口设置来管理... 在网络管理中,总是有些人让管理员头疼。下面我们就将介绍一下一个网管员利用交换机以及端口设置等来进行D...
全面诠释网络负载均衡 负载均衡的出现大大缓解了服务器的压力,更是有效的利用了资源,提高了效率。那么我们现在来说一下网络负载...
如何允许远程连接到MySQL数... [[277004]]【51CTO.com快译】默认情况下,MySQL服务器仅侦听来自localhos...
30分钟搞定iOS自定义相机 最近公司的项目中用到了相机,由于不用系统的相机,UI给的相机切图,必须自定义才可以。就花时间简单研究...
Intel将Moblin社区控... 本周二,非营利机构Linux基金会宣布,他们将担负起Moblin社区的管理工作,而这之前,Mobli...