数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 51|回复: 1

[业界] 国内已知最大规模!消息称字节跳动正讨论训练超5万亿参数模型

[复制链接]
发表于 3 小时前 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
IT之家 8 月 6 日消息,晚点 LatePost 今天(6 日)晚间爆料称,字节跳动正在讨论训练一个参数规模超 5 万亿的模型,超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),也是目前国内已知参数规模最大的模型。通常而言,模型规模越大,智能水平往往越高,不过该计划仍处于早期阶段。
消息称该模型将由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。二人均是字节跳动 AI 及大模型研发体系内的核心骨干,并出自字节的“搜广推”体系。
项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016 年加入字节,曾负责机器学习中台 AML 团队,后调任豆包大模型 Foundation 团队任负责人。沈科 2018 年清华毕业,同年加入字节,现主要负责 LLM 预训练数据。
IT之家从报道中获悉,多名字节跳动人士透露,上半年多个 Seed 团队已开始不断反思,而这也是字节讨论训练超 5 万亿参数模型的原因之一。其中一人直言,把参数规模一次推到同行的数倍来争取领先位置的举措“像一场赌博”。


两周前的 Seed 全员会上,字节跳动创始人张一鸣安抚了 Seed 的成员。他认为,训大模型本就是一件很难的事,团队不必过度焦虑。他明确一段时间内可接受模型落后于行业,希望大家以追求智能上限为目标,期待 Seed 模型能力能跻身世界第一梯队。
张一鸣认为编程是当前的关键方向,并表态自己反对蒸馏。在其看来,蒸馏能在短期内改善模型表现,但本质上仍是在复制 Claude 已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。





发表于 1 小时前 | 显示全部楼层
游客请登录后查看回复内容
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-7 11:58 , Processed in 0.062400 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表