部署大型模型需要端到端的工具链协作,涵盖训练、算子、推理、编排和安全分发。PyTorch 基金会建立了“托管项目”和“生态系统项目”两级矩阵,连接了 100 多个覆盖 AI 开发各阶段的项目。在本次演讲中,PyTorch 大使首先介绍基金会的运作模式和治理逻辑,然后沿着大语言模型的开发生命周期,逐一介绍 PyTorch 基金会旗下的各个托管项目:PyTorch 提供从 eager 模式到 torch.compile 的核心框架;DeepSpeed 处理数千亿参数规模的分布式训练和推理优化;Helion 允许用原生 PyTorch 语法编写高性能算子并实现自动调优;vLLM 通过 PagedAttention 实现高吞吐量推理;Ray 支持弹性编排和 serving,将推理引擎平滑扩展到生产集群;Safetensors 以安全、无 pickle 的格式存储模型权重。本次演讲涵盖了整个 PyTorch 生态格局以及这些项目之间的协作关系,为听众提供了一张清晰的 AI 开发路线图。