清华开源edge-dit.cpp|面向端侧的DiT引擎
最近,我们正式开源了 edge-dit.cpp。
这是一个面向本地设备和有限计算资源场景的原生 C/C++ Diffusion Transformer 推理引擎。
为什么做它?
FLUX、SD3、Qwen-Image、Wan 等生成模型快速发展,但将这些大模型部署到端侧设备时,仍面临:
❌ 显存占用高
❌ Python/PyTorch 环境复杂
❌ 模型适配成本高
❌ 难以集成原生应用
因此,我们构建了一套面向端侧与低资源环境的 DiT 推理运行时,让更大的生成模型在有限显存中运行。
🚀 核心能力:
💾 低显存自动适配
通过 `--auto-fit` 根据显存预算自动选择量化精度和组件放置策略。
📦 多级显存优化
支持组件级卸载、DiT 分层卸载、CUDA 异步传输、VAE Tiling 和显存预算控制。
⚙️ 原生 C/C++ 推理
基于 ggml 构建,推理阶段无需 Python/PyTorch,提供对张量、计算图和设备的细粒度控制。
🗜️ 面向部署的量化
支持 q8_0 到 q4_K 量化,并提供 `ed-convert` 转换预量化 GGUF。
🧩 一个运行时覆盖多类生成任务:
🎨 文生图
🖼️ 图像编辑
🎬 视频生成
支持:
SD3 / SD3.5、FLUX.1 / Kontext、Qwen-Image / Edit、Wan 2.1
同时支持:
FLUX.1-schnell、SD3.5-medium-turbo、Lightning、Qwen Lightning、Wan Distill 等少步蒸馏模型。
🌐 多后端支持:
CUDA、CPU、Vulkan、Metal(实验性)
提供 CLI、C API、HTTP Server 和 Python Binding。
⚡ 不只是模型 C++ 复现:
持续推进 DiT 专用 CUDA 算子、混合精度、计算复用等系统优化。
目前已完成 RTX 4090 和 H200 benchmark,并与 Diffusers、stable-diffusion.cpp 对比。
我们的目标:
构建面向本地部署、边缘计算、资源受限设备的轻量级 DiT 推理基础设施。
📌 项目:
-MIG/edge-dit.cpp
欢迎关注、体验和贡献 ⭐
开源项目 端侧部署 边缘计算 低显存推理 Diffusion CUDA
