8 月 20 日,商汤正式开源了 SenseNova-U1.5-8B-MoT(Apache-2.0)。这是一个只有 8B 参数的统一多模态模型:文生图、图像编辑、视觉理解全在一个模型里完成,支持原生 4K 直出、3-4k 字符超长指令,在复杂排版和局部编辑上能对标 GPT-Image-2。关键是——8B 意味着单卡就能本地跑。
对开发者来说,最有价值的是:没有 Router、不用把多个专家模型拼成流水线,交付的就是一个 8B checkpoint。调用链路短、部署成本低,仓库还自带推理脚本、ComfyUI workflow 和 8 步蒸馏 LoRA,迭代效率直接翻几倍。
正式版改了什么
U1.5 沿用 SenseNova-U1 的 NEO-unify 架构:像素和 token 在同一个 MoT 骨干里端到端建模,去掉了视觉编码器(VE)和 VAE。正式版主要在训练上做文章:
- 先拆开练、再合回来:文字渲染、美学、图像编辑先各自训练专项 Expert,再用 MOPD(多教师在线策略蒸馏)融合回同一个模型。交付时你拿到的仍然只有一个 8B 模型。
- 后训练重点强化三件事:指令遵循(主体数量、位置、样式、"不许改"区域)、视觉偏好(构图、材质、光影)、编辑保持(未编辑区域不动)。
- 提示词增强(PE):把一句话需求先整理成结构化的 Render JSON 再交给模型,复杂任务强烈建议走这一步。
本地部署三步走
参考环境:Python 3.11 + PyTorch 2.8 + CUDA 12.8,用 uv 一把梭:
# 1. 安装
git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
uv sync
source .venv/bin/activate
# 2. 文生图:原生 4K 直出
python examples/t2i/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT \
--prompt "A cinematic mountain lake at sunrise, realistic photography." \
--width 2048 --height 2048 \
--device_map auto \
--output output.png
# 3. 图像编辑:明确告诉模型哪些不能动
python examples/editing/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT \
--image input.png \
--prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \
--output edited.png
提速:8 步蒸馏 LoRA
官方基座是 50 步采样(cfg_scale 4.0),官方发布的 8 步 LoRA 把采样压到 8 步(cfg_scale 1.0),批量出图、反复调 prompt 的场景快好几倍:
hf download sensenova/SenseNova-U1.5-8B-MoT-LoRAs \
SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
--local-dir ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs
python examples/t2i/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT \
--lora_path ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs/SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
--prompt "A recipe sharing card with nine dishes arranged in a clean grid." \
--cfg_scale 1.0 --cfg_norm none --timestep_shift 3.0 --num_steps 8 \
--output fast.png
显存不够?社区已放出 U1.5 Preview 的 Q8 GGUF 量化版(约 20GB),官方 GGUF 也在路上——用 --gguf_checkpoint 指定量化文件即可。仓库里还有 ComfyUI workflow(apps/comfyui)和生产部署方案(LightLLM + LightX2V)。
实操建议
- 编辑时把"不许改"写清楚:像 "Preserve the face, pose, background, lighting, and framing" 这种约束,比只描述改动目标更稳。
- 颜色/细节过冲就调低
cfg_scale:高频细节过重、饱和度溢出是已知毛病,降 cfg 通常能解决。 - 复杂任务先走 PE:多主体、多参考图、文字密集的场景,先用
src/sensenova_u1_5/image_pe.py(接任意 OpenAI 兼容 API)把需求整理成 Render JSON 再生成。 - 注意短板:密集小字中英混排、严格数量对齐的版式、人脸/手部,以及多轮多参考编辑容易翻车。单参考图的一次性编辑最可靠。
资源
- GitHub:OpenSenseNova/SenseNova-U1
- 模型:SenseNova-U1.5-8B-MoT(HF) / ModelScope / HF 模型集合
- 在线体验:SenseNova-Studio
- 技术报告:arXiv:2605.12500;官方 Best Practices 见仓库
docs/u1.5_best_practices.md