跳到正文
原文
Replicate · 模型与制作实践·· 2025-09-08精选AI 评分73

Replicate 为 torch.compile 编译产物增加缓存,模型冷启动提速 2–3 倍

Torch compile caching for inference speed

AI 导读

Replicate 开始缓存 PyTorch 模型的 torch.compile 编译产物,以减少模型容器启动时的编译开销,black-forest-labs/flux-kontext-dev、prunaai/flux-schnell 和 prunaai/flux.1-dev-lora 的启动速度提升 2–3 倍。

推荐理由

Replicate的缓存机制针对torch.compile首次编译开销,给出了多个模型冷启动时间变化,可用于评估部署优化收益。

来源:Replicate · 模型与制作实践 · replicate.com