大模型推理部署:vLLM 与性能优化实践
从 API 服务到自建推理,用 vLLM 上线大模型服务,掌握 KV Cache、连续批处理与量化三板斧。
搜索全站文章、教程与内容。
共找到 3 条结果(关键词:Python)
从 API 服务到自建推理,用 vLLM 上线大模型服务,掌握 KV Cache、连续批处理与量化三板斧。
用 PyTorch 搭一个识别手写数字的 CNN,完整走一遍数据加载、模型定义、训练与评估全流程。
为什么微调比从零训练省得多?用 LoRA 冻结原模型、只训练低秩增量,在自己的数据上定制大模型。