小红书开源 InstanceAssemble:轻量级布局可控生成框架助力高精度图像生成

小红书正式开源了 InstanceAssemble 框架,这是一款面向 布局可控图像生成(Layout-to-Image Generation) 任务的轻量级AI框架,重点优化了在复杂多实例场景下的生成质量与空间对齐表现。通过结合 级联建模(Cascaded Modeling)Assemble-Attention机制,InstanceAssemble 在保持低参数开销的同时,实现了更高的生成精度与语义一致性。


级联建模与 Assemble-Attention 机制

InstanceAssemble 采用了多阶段的级联建模结构,在每个阶段都通过 Assemble-Attention 对不同实例间的空间关系与语义关联进行动态建模。
这种方式能有效应对多物体堆叠、遮挡与重叠等复杂情况,使得生成结果的结构清晰、边界明确,提升了整体的画面协调性。


⚙️ 轻量级设计与高兼容性

相比传统的大型生成模型,InstanceAssemble 保持了极高的运行效率。
框架的参数增量仅 0.84%,可与主流扩散模型(如 Stable Diffusion、PixArt、SDXL 等)无缝结合。
这一设计使得开发者能够在不牺牲速度与性能的前提下,快速集成布局可控功能,从而满足实际生产与设计需求。


DenseLayout 基准推动布局评测标准化

为进一步推动布局可控生成的研究与评测标准,小红书团队还自建了 DenseLayout Benchmark
该基准提供了对空间布局、实例对齐与语义完整度的细粒度评估指标,帮助研究者与开发者更系统地衡量模型性能,推动布局生成领域的标准化发展。


应用价值与行业场景

InstanceAssemble 在多个实际场景中具备强大的应用潜力:

  • 电商图像生成:支持复杂商品组合与多物体场景下的自动构图。
  • 视觉设计创作:帮助设计师在指定布局下快速生成多样化视觉方案。
  • 广告与内容生产:通过语义可控生成实现素材定制化,提高制作效率。

其轻量化、可扩展的特性,让 InstanceAssemble 成为工业级 AI 视觉系统的重要组成部分。


了解更多

框架论文与开源细节请见:
https://arxiv.org/abs/2509.16691