SenseNova U1.5 正式版开源:8B 模型本地跑 4K 生图与精准编辑

8 月 20 日,商汤正式开源了 SenseNova-U1.5-8B-MoT(Apache-2.0)。这是一个只有 8B 参数的统一多模态模型:文生图、图像编辑、视觉理解全在一个模型里完成,支持原生 4K 直出、3-4k 字符超长指令,在复杂排版和局部编辑上能对标 GPT-Image-2。关键是——8B 意味着单卡就能本地跑。

对开发者来说,最有价值的是:没有 Router、不用把多个专家模型拼成流水线,交付的就是一个 8B checkpoint。调用链路短、部署成本低,仓库还自带推理脚本、ComfyUI workflow 和 8 步蒸馏 LoRA,迭代效率直接翻几倍。

正式版改了什么

U1.5 沿用 SenseNova-U1 的 NEO-unify 架构:像素和 token 在同一个 MoT 骨干里端到端建模,去掉了视觉编码器(VE)和 VAE。正式版主要在训练上做文章:

  • 先拆开练、再合回来:文字渲染、美学、图像编辑先各自训练专项 Expert,再用 MOPD(多教师在线策略蒸馏)融合回同一个模型。交付时你拿到的仍然只有一个 8B 模型。
  • 后训练重点强化三件事:指令遵循(主体数量、位置、样式、"不许改"区域)、视觉偏好(构图、材质、光影)、编辑保持(未编辑区域不动)。
  • 提示词增强(PE):把一句话需求先整理成结构化的 Render JSON 再交给模型,复杂任务强烈建议走这一步。

本地部署三步走

参考环境:Python 3.11 + PyTorch 2.8 + CUDA 12.8,用 uv 一把梭:

# 1. 安装
git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
uv sync
source .venv/bin/activate
# 2. 文生图:原生 4K 直出
python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --prompt "A cinematic mountain lake at sunrise, realistic photography." \
  --width 2048 --height 2048 \
  --device_map auto \
  --output output.png
# 3. 图像编辑:明确告诉模型哪些不能动
python examples/editing/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --image input.png \
  --prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \
  --output edited.png

提速:8 步蒸馏 LoRA

官方基座是 50 步采样(cfg_scale 4.0),官方发布的 8 步 LoRA 把采样压到 8 步(cfg_scale 1.0),批量出图、反复调 prompt 的场景快好几倍:

hf download sensenova/SenseNova-U1.5-8B-MoT-LoRAs \
  SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
  --local-dir ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs

python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --lora_path ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs/SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
  --prompt "A recipe sharing card with nine dishes arranged in a clean grid." \
  --cfg_scale 1.0 --cfg_norm none --timestep_shift 3.0 --num_steps 8 \
  --output fast.png

显存不够?社区已放出 U1.5 Preview 的 Q8 GGUF 量化版(约 20GB),官方 GGUF 也在路上——用 --gguf_checkpoint 指定量化文件即可。仓库里还有 ComfyUI workflow(apps/comfyui)和生产部署方案(LightLLM + LightX2V)。

实操建议

  • 编辑时把"不许改"写清楚:像 "Preserve the face, pose, background, lighting, and framing" 这种约束,比只描述改动目标更稳。
  • 颜色/细节过冲就调低 cfg_scale高频细节过重、饱和度溢出是已知毛病,降 cfg 通常能解决。
  • 复杂任务先走 PE:多主体、多参考图、文字密集的场景,先用 src/sensenova_u1_5/image_pe.py(接任意 OpenAI 兼容 API)把需求整理成 Render JSON 再生成。
  • 注意短板:密集小字中英混排、严格数量对齐的版式、人脸/手部,以及多轮多参考编辑容易翻车。单参考图的一次性编辑最可靠。

资源

发表评论

滚动至顶部