大家好,我是山山。建站第 105 天,周五。
今天 AI 圈炸了。
▎5万亿参数
字节跳动正在讨论训练一个参数规模超 5 万亿的大模型,超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),成为国内已知参数规模最大的模型。
5 万亿是什么概念?GPT-4 据传是 1.8 万亿参数。5 万亿是 GPT-4 的近 3 倍。
这个项目由 Seed Foundation 负责人项亮主导,Seed 团队正在重新梳理组织架构、划分职责、分配资源。计划还处于早期阶段,但方向已经很明确:字节要在参数规模上做到国内第一。
▎参数军备竞赛的底层逻辑
为什么大家都在拼参数?
因为目前的大模型竞争,本质上还是规模竞争。更多参数 = 更强推理能力 = 更好用户体验 = 更多开发者 = 更多收入。
但参数不是万能的。训练 5 万亿参数需要海量算力和数据。如果没有足够的 GPU 集群、没有高质量的数据清洗流程、没有高效的分布式训练框架,参数再多也训不出来。
这就是为什么特斯拉今天也上了牌桌——
▎168亿美元建芯片工厂
SpaceX 与特斯拉首期投入 168 亿美元,在得州建设 Terafab 先进 AI 芯片制造基地。马斯克誓言"把尖端制造带回美国"。
这不是造汽车,是造 AI 的"心脏"。当算力成为 AI 时代的石油,芯片工厂就是炼油厂。
字节要训 5 万亿参数,需要大量 GPU。特斯拉建芯片工厂,是在给整个 AI 产业提供"燃料"。两条新闻看似无关,实则指向同一个趋势:AI 基础设施的军备竞赛已经开始了。
▎阿里云 Wan3.0 公测
比起参数竞赛,今天还有一条更"落地"的新闻:阿里云视频生成模型 Wan3.0 开启公测,单次可生成 30 秒视频,首次支持文档格式输入。
30 秒视频是什么概念?足够做一条短视频广告的开头,足够做一段产品演示,足够做一条教学短视频。
这对半百观来说是个好消息——以后做短视频,可以先用 Wan3.0 生成初版素材,再人工精修。效率至少提升 3 倍。
▎今天的思考
5 万亿参数、168 亿美元、30 秒视频——三个数字,三个方向。
参数竞赛是上游,芯片工厂是基础设施,视频生成是应用层。AI 产业从上游到基础设施到应用层,今天同时发生了三件大事。
对我们这种小团队来说,上游和基础设施的事做不了,但应用层的事必须跟上。Wan3.0 公测,值得第一时间测试。
105天,周五。字节要训5万亿参数,特斯拉要建芯片工厂,阿里云要让你30秒出视频。上游在卷规模,基础设施在卷产能,应用在卷效率。我们做不了上游,但应用层必须跟上。