A Black Forest Labs detalha o FLUX 3 Image, modelo de geração de imagem que aceita layout por coordenadas, renderiza em 4K nativo e permite editar elemento por elemento sem regenerar a cena inteira.

O que é o FLUX 3 Image
Black Forest Labs, empresa alemã por trás da família de modelos de geração de imagem FLUX, publicou a página de produto do FLUX 3 Image (fonte: bfl.ai/models/flux-3-image). O modelo é descrito como texto-para-imagem com "prompt following forte e entendimento nativo de composição", e a própria página já mira quem integra isso em produto: há link para "Read the docs" e para "Contact Sales", separando uso via API de licenciamento comercial para rodar em infraestrutura própria.
Para quem constrói com modelos de imagem, o que chama atenção no FLUX 3 Image não é só qualidade visual: é um conjunto de recursos que ataca gambiarras comuns em produção, como prompt gigante para descrever layout, upscaling separado para alta resolução e regeneração da imagem inteira só para mudar um detalhe.
Bounding boxes: compor a cena antes de gerar o pixel
Em vez de descrever a posição de cada elemento em texto corrido, o FLUX 3 Image aceita uma lista de caixas delimitadoras (bounding boxes): cada item tem um id, coordenadas de pixel e uma descrição curta do que deve aparecer ali. A documentação da Black Forest Labs mostra um exemplo real, usado para gerar a peça "Le Festival du Soleil":
{ "id": "dome_1", "bbox": [250, 150, 650, 850], "desc": "a massive, smooth parabolic dome of pale concrete" }Cada objeto da cena (o texto do título, as luzes da cidade ao fundo, os nadadores na água, a multidão na praia) vira uma entrada separada nessa lista, com sua própria área e descrição. O modelo recebe o conjunto inteiro e resolve tudo numa única geração, respeitando onde cada elemento deve ficar.
Na prática, isso transforma geração de imagem em algo parecido com montar um layout de interface: em vez de prompt engineering↳Engenharia de prompt6 conteúdosEngenharia de Prompt: a profissão do futuro que vai mudar sua vida (e sua conta bancária)Gestão Dev & TI · abr 2025Melhores técnicas de engenharia de prompt para IAGestão Dev & TI · nov 2024Engenharia de Prompt + Programação: Como Trabalhar com IA na Prática (Com Código Python Integrado)Dev (Back & Front) · abr 2025Ver tudo em AI → para forçar posicionamento, o desenvolvedor passa uma estrutura de dados. É o tipo de input que dá para gerar programaticamente a partir de um template de design, de um layout salvo em banco ou de uma grade de componentes já existente no produto.
O ângulo de agente: quem monta o layout pode ser outro modelo
A Black Forest Labs é direta sobre o caso de uso:
O FLUX 3 Image é treinado nativamente para entender layout e composição de imagem. Um agente pode usar o modelo para criar facilmente imagens bem compostas só com um prompt de texto.
FLUX 3 Image is natively trained to understand image layout and composition. An agent can use the model to easily create well-composed images with just a text prompt.Black Forest Labs, página de produto do FLUX 3 Image
Isso encaixa num padrão de pipeline que já aparece em produtos agentic: um primeiro passo (um agente, ou o próprio modelo) planeja onde cada elemento vai, e a renderização final respeita esse plano. Para quem constrói um agente que gera material de marketing, mockup de produto ou asset de jogo, o ganho é não precisar escrever e manter um prompt gigante tentando descrever espaço, proporção e hierarquia visual ao mesmo tempo.
Render nativo em 4K, sem passo de upscaling
A página mostra exemplos gerados "at full resolution", citando como caso o render "Soba shop, 5456 × 3072 pixels, all from the model" (fonte: bfl.ai/models/flux-3-image). A ressalva "all from the model" importa: não é upscale rodado depois por outro modelo, é a própria geração entregando textura, rosto e cor preservados já na resolução final.
Para quem monta uma esteira de produção de imagem, isso corta uma etapa: hoje é comum gerar em resolução baixa e rodar um modelo de super-resolução separado, com seu próprio custo de GPU e sua própria fila, só para chegar a 4K. Se o FLUX 3 Image sustenta esse resultado nativamente, o pipeline fica mais simples e com menos pontos de falha.
Edição pixel a pixel, caixa por caixa
Além de gerar do zero, o modelo aceita edição direcionada por caixa. A documentação mostra os exemplos "Recolor wetsuit and board, edited box by box, with everything else unchanged" e "Add two divers, before and after a pixel-perfect edit" (fonte: bfl.ai/models/flux-3-image). A lógica é referenciar o id de um elemento específico e pedir uma alteração, mantendo o resto da imagem intacto.
Isso difere de inpainting genérico por máscara livre. Como a imagem já nasce com uma estrutura de elementos nomeados, editar vira uma operação sobre um elemento específico, não sobre uma região recortada à mão. Para catálogo de produto, isso significa gerar variações de cor ou de peça, como no exemplo do traje de mergulho e da prancha, sem recriar fundo, modelo e iluminação inteiros a cada variação.
Até 10 imagens de referência numa composição só
O FLUX 3 Image também aceita até 10 imagens de referência para montar uma composição nova, segundo a página ("Use up to 10 references to create a thoughtfully designed image with less effort"). Os exemplos mostrados, como "Times Square fit" e "Kids room", sugerem uso para moodboard, montagem de lookbook e composição de cena a partir de assets já existentes, sem precisar descrever cada referência em texto corrido.
Licenciamento: pesos comerciais para rodar em infraestrutura própria
Para quem roda geração de imagem em escala, a Black Forest Labs oferece o FLUX 3 Image sob "licença de pesos comerciais" (commercial weights license): a empresa permite fazer fine-tune e deploy do modelo na infraestrutura do próprio cliente, mas o acesso passa por contato comercial direto ("Contact sales"), sem preço público divulgado na página-fonte.
Isso separa dois públicos. Quem quer testar e integrar via API tem os links "Try it" e "Read the docs" como caminho direto. Quem precisa rodar em volume, com controle de custo de GPU e sem depender da API pública da empresa, normalmente é quem tem catálogo de e-commerce↳E-commerce21 conteúdosECBR Club: novo espaço para devs se conectarem ao ecossistema de e-commerceDev (Back & Front) · mai 2025TOTVS anuncia joint venture com VTEXMarketing Tech · mai 2019Jovens da Brasilândia recebem formação gratuita em tecnologiaGestão Dev & TI · jul 2025Ver tudo em Marketing Tech →, publicidade programática ou exigência de que os dados não saiam da própria rede.
O que ainda fica em aberto
A página de produto não traz preço de API, não publica benchmark comparando o FLUX 3 Image a modelos concorrentes nem a versões anteriores da própria família FLUX, e não detalha latência ou custo por imagem nas resoluções mostradas. Quem for avaliar o modelo para produto vai precisar rodar o próprio teste via API antes de decidir entre usar o serviço hospedado ou negociar os pesos comerciais para self-host.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Modelo de 125 bilhões de parâmetros roda em GPU de 12 GB com o Strata
O projeto de código aberto Strata faz o modelo Qwen3.8-Flash-Next, de 125 bilhões de parâmetros, funcionar em placas de vídeo comuns, dividindo o trabalho entre GPU, RAM e processador.














