十字路口Crossing

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

July 19, 2026·41 min
Episode Description from the Publisher

🚥 没人喜欢等待。模型越强,推理加速就越重要。这一期,我们聊「推理加速」。本周「十字路口」的嘉宾是生数科技的张金涛。月初,他带队发布了 Vidu S1——一个实时交互视频模型:上传一张照片,无论是人物、动漫角色,还是一只宠物,都能变成一个可以和你实时视频通话的 AI 角色。Vidu S1 很快,快到生成速度超过播放速度,并且支持无限时长。这是怎么做到的?金涛在播客中分享了自己这几年一条清晰的技术主线:从 SageAttention(GitHub 3.5K 星标)、TurboDiffusion(GitHub 3.6K 星标),到 TurboServe——一整套系统级方案,为 S1 实时交互提供底层支撑。此外,金涛也分享了他对整个 AI「推理加速」领域的观察和判断。其实这期有意思的,不只是技术。金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」所以这期节目,你也可以把它当成一份「年轻研究者样本」来听:在变化极快的 AI 领域,怎么找到自己的方向、怎么判断什么才是「最正确的事」,又怎么把它一路做到最前沿。🎬 我们的视频播客将同步上线于 @Koji杨远骋 的视频号、抖音、小红书、哔哩哔哩、Youtube 等平台。📒 文字版将发布于 @十字路口Crossing 公众号。🟢 01:40 快问快答:年龄、毕业院校、MBTI 与星座、Vidu S1,以及在生数科技负责的工作🟢 02:48 硬件上明明有更快的计算单元“为什么没有人做?这是很明显的一个收益。”当大家认为 FlashAttention 已接近极致,张金涛发现 GPU 上仍有更快的计算单元没有用于 Attention。语言模型早期的 Attention 更受显存传输限制,视频生成模型却严重受计算速度限制。SageAttention 要同时解决底层 GPU Kernel 编程和低比特计算的精度损失,最终成为即插即用的加速方案。🟢 06:15 从 SageAttention 到 Vidu S1:三层加速算子层:让 Attention、线性层等计算尽可能逼近硬件上限。模型层:通过步数蒸馏和稀疏 Attention,把 Diffusion 去噪从约 50 步降到 4 步。部署层:解决多卡并行、通信与计算重叠、用户请求调度。SageAttention 后来成为事实上的行业标准;TurboDiffusion 推进模型加速,TurboServe 负责流式视频的集群部署。🟢 11:24 Vidu S1 不只是快“生成速度需要大于播放速度,它才能做到实时生成。”普通视频模型等待很久生成一段成片,流式模型则要根据用户输入逐帧生成。Vidu S1 实现 540P、25–42 FPS,并能在消费级显卡上运行。比速度更难的是无限时长:生成一两个小时后,画面仍不能漂移或崩坏,还要持续正确回应用户。实时交互是第一目标,当前阶段可以适度牺牲画质,但不能牺牲速度。🟢 15:21 “未来我们的视觉娱乐信号,会被 AI 生成的内容充斥掉。”电影和短视频是预先生成的离线内容,聊天、恋爱、游戏和日常生活则充满实时视觉互动。离线视频可以共享播放,实时视频需要为每个人生成不同内容。张金涛判断,实时交互视觉娱乐的需求会比离线内容更大,而且这条路径已经势不可挡。🟢 17:30 一只狗和一个游戏搭子用户已经开始上传宠物图片与它聊天,也有人让二次元角色实时观看游戏画面、陪自己玩游戏。Vidu S1 能理解输入的视频流;把电脑屏幕传给它,它也可以成为看懂 Coding、微信和 Notion 的“程序员鼓励师”。🟢 20:05 推理加速不只是算子算子加速之外,还要用稀疏 Attention、MoE 和蒸馏减少模型本身的计算量。流式 Diffusion 会引入 KV Cache,还要处理用户随时进入、退出,以及多机多卡的集群调度。TurboServe 对应的正是 Serving 层:把计算图、通信与请求调度组合成真正可部署的系统。🟢 24:39 推理加速的未来,属于更底层和更上层“推理加速的未来,还是属于更底层和更上层。”中间的算子层会随着编程工具进步逐渐收敛;更底层是面向通用或特定模型设计芯片,更上层是用算法直接减少计算。像 Taalas 这样针对特定模型做硬件设计,本质是在通用性与极致效率之间取舍。真正有壁垒的加速需要软硬件 Co-Design:只懂算法,很难判断方案在真实硬件上是否有效。🟢 28:28 中国视频模型的领先原因Transformer 之后,模型结构逐渐收敛,差距更多来自数据量、数据质量、偏好对齐和数据是否容易学习。低质量数据不只是没用,还会污染模型;高质量解释能让模型更快学会关键概念。中国的短视频、直播与电商生态既产生真实需求,也沉淀了更丰富的视频数据;张金涛认为中国视频模型公司目前领先美国。🟢 33:10 世界领先,是把每个环节都做对“知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。”朱军让他理解,GPT-3 的成功不是靠某个神秘技巧,而是把每个环节都推到极致。两行有问题的代码就足以让实验失败;负责人必须能判断方案是否正确、实现是否到位。带团队还要看见每个人真正想要的是工资、Credit 还是成就感,再从第一性原理协调不同部门。🟢 37:54 一行代码,速度快一倍“视频生成得跟之前像素级一模一样,但端到端推理速度快了一倍多。”在清华安静的楼里,他一个线程一个线程地排查底层问题,终于让 SageAttention 跑通。把 Vidu 里的 FlashAttention 换成 SageAttention 只需改一行代码,输出保持像素级一致,端到端速度却提升一倍多。他立刻把结果发给陈建飞和朱军;后来又带队负责 Vidu 推理与 S1,把这段经历形容得“像在创业”。这段最快乐的科研时光,也来自朱军给出的方向、资源和自由氛围。欢迎订阅「十字路口」:🚦 我们关注新一代 AI 技术浪潮带来的行业新变化和创业新机会。🚦 十字路

Podzilla Summary coming soon

Sign up to get notified when the full AI-powered summary is ready.

Get Free Summaries →

Free forever for up to 3 podcasts. No credit card required.

Listen to This Episode

Get summaries like this every morning.

Free AI-powered recaps of 十字路口Crossing and your other favorite podcasts, delivered to your inbox.

Get Free Summaries →

Free forever for up to 3 podcasts. No credit card required.