DC娱乐网

清华开源edge-dit.cpp|面向端侧的DiT引擎 最近,我们正式开源了 e

清华开源edge-dit.cpp|面向端侧的DiT引擎
最近,我们正式开源了 edge-dit.cpp。

这是一个面向本地设备和有限计算资源场景的原生 C/C++ Diffusion Transformer 推理引擎。

为什么做它?

FLUX、SD3、Qwen-Image、Wan 等生成模型快速发展,但将这些大模型部署到端侧设备时,仍面临:

❌ 显存占用高
❌ Python/PyTorch 环境复杂
❌ 模型适配成本高
❌ 难以集成原生应用

因此,我们构建了一套面向端侧与低资源环境的 DiT 推理运行时,让更大的生成模型在有限显存中运行。

🚀 核心能力:

💾 低显存自动适配
通过 `--auto-fit` 根据显存预算自动选择量化精度和组件放置策略。

📦 多级显存优化
支持组件级卸载、DiT 分层卸载、CUDA 异步传输、VAE Tiling 和显存预算控制。

⚙️ 原生 C/C++ 推理
基于 ggml 构建,推理阶段无需 Python/PyTorch,提供对张量、计算图和设备的细粒度控制。

🗜️ 面向部署的量化
支持 q8_0 到 q4_K 量化,并提供 `ed-convert` 转换预量化 GGUF。

🧩 一个运行时覆盖多类生成任务:

🎨 文生图
🖼️ 图像编辑
🎬 视频生成

支持:
SD3 / SD3.5、FLUX.1 / Kontext、Qwen-Image / Edit、Wan 2.1

同时支持:
FLUX.1-schnell、SD3.5-medium-turbo、Lightning、Qwen Lightning、Wan Distill 等少步蒸馏模型。

🌐 多后端支持:
CUDA、CPU、Vulkan、Metal(实验性)

提供 CLI、C API、HTTP Server 和 Python Binding。

⚡ 不只是模型 C++ 复现:
持续推进 DiT 专用 CUDA 算子、混合精度、计算复用等系统优化。

目前已完成 RTX 4090 和 H200 benchmark,并与 Diffusers、stable-diffusion.cpp 对比。

我们的目标:
构建面向本地部署、边缘计算、资源受限设备的轻量级 DiT 推理基础设施。

📌 项目:
-MIG/edge-dit.cpp

欢迎关注、体验和贡献 ⭐

开源项目 端侧部署 边缘计算 低显存推理 Diffusion CUDA