本地大模型选型实践

闪电演讲
深圳
14:30 - 14:40
  • 代少飞 恒程知识产权 技术总监

    十多年 Python 开发经验,PyCon China 组委会成员

    daishaofei

摘要

处理长文本时,硬件选择比模型更关键。M3 Ultra、Mac Pro M5 Max 的统一内存对长上下文更友好,RTX 4090、5090 则在吞吐和并发上更强。但 AI 给不了准确答案——真实表现取决于带宽、KV Cache、框架优化,还要综合考虑性价比,让我们看看实测数据,最终选择...

详情

处理长文本时,硬件选择比模型更关键。M3 Ultra、Mac Pro M5 Max 的统一内存对长上下文更友好,RTX 4090、5090 则在吞吐和并发上更强。但 AI 给不了准确答案——真实表现取决于带宽、KV Cache、框架优化,还要综合考虑性价比,让我们看看实测数据,最终选择...