大模型时代的 PyTorch 生态

主题演讲
  • 肖智清 PyTorch 基金会大使

    资深 Python 和 PyTorch 开发者。著有或许是全球首本 TensorFlow 和 PyTorch 对照代码的强化学习教程书《强化学习:原理与Python实现》、或许是全球首本 PyTorch 1纸质教程书《神经网络与PyTorch实战》。开源贡献被 sklearn、scipy、statsmodels、gym 等 Python 库在 release note 里认可。清华大学博士。在 IEEE TIT、IEEE TComm 等期刊以第一作者发表论文。

    肖智清 Zhiqing Xiao

摘要

以大模型时代的 PyTorch 生态为主线,从 PyTorch 的训练基础出发,依次介绍 Helion 如何加速底层算子、DeepSpeed 如何支撑分布式训练、Safetensors 如何承载和分发模型权重、vLLM 如何提升大模型推理吞吐、Ray 如何编排分布式任务,梳理 PyTorch 基金会维护的从模型训练到生产系统的全链路开源基础设施。

详情

部署大型模型需要端到端的工具链协作,涵盖训练、算子、推理、编排和安全分发。PyTorch 基金会建立了“托管项目”和“生态系统项目”两级矩阵,连接了 100 多个覆盖 AI 开发各阶段的项目。在本次演讲中,PyTorch 大使首先介绍基金会的运作模式和治理逻辑,然后沿着大语言模型的开发生命周期,逐一介绍 PyTorch 基金会旗下的各个托管项目:PyTorch 提供从 eager 模式到 torch.compile 的核心框架;DeepSpeed 处理数千亿参数规模的分布式训练和推理优化;Helion 允许用原生 PyTorch 语法编写高性能算子并实现自动调优;vLLM 通过 PagedAttention 实现高吞吐量推理;Ray 支持弹性编排和 serving,将推理引擎平滑扩展到生产集群;Safetensors 以安全、无 pickle 的格式存储模型权重。本次演讲涵盖了整个 PyTorch 生态格局以及这些项目之间的协作关系,为听众提供了一张清晰的 AI 开发路线图。