AINOTÍCIA

FLUX 3 Image traz controle por bounding boxes e render nativo em 4K

A Black Forest Labs detalha o FLUX 3 Image, modelo de geração de imagem que aceita layout por coordenadas, renderiza em 4K nativo e permite editar elemento por elemento sem regenerar a cena inteira.

FLUX 3 Image traz controle por bounding boxes e render nativo em 4K
Imagem gerada por IA

O que é o FLUX 3 Image

Black Forest Labs, empresa alemã por trás da família de modelos de geração de imagem FLUX, publicou a página de produto do FLUX 3 Image (fonte: bfl.ai/models/flux-3-image). O modelo é descrito como texto-para-imagem com "prompt following forte e entendimento nativo de composição", e a própria página já mira quem integra isso em produto: há link para "Read the docs" e para "Contact Sales", separando uso via API de licenciamento comercial para rodar em infraestrutura própria.

Para quem constrói com modelos de imagem, o que chama atenção no FLUX 3 Image não é só qualidade visual: é um conjunto de recursos que ataca gambiarras comuns em produção, como prompt gigante para descrever layout, upscaling separado para alta resolução e regeneração da imagem inteira só para mudar um detalhe.

Bounding boxes: compor a cena antes de gerar o pixel

Em vez de descrever a posição de cada elemento em texto corrido, o FLUX 3 Image aceita uma lista de caixas delimitadoras (bounding boxes): cada item tem um id, coordenadas de pixel e uma descrição curta do que deve aparecer ali. A documentação da Black Forest Labs mostra um exemplo real, usado para gerar a peça "Le Festival du Soleil":

json
{ "id": "dome_1", "bbox": [250, 150, 650, 850], "desc": "a massive, smooth parabolic dome of pale concrete" }

Cada objeto da cena (o texto do título, as luzes da cidade ao fundo, os nadadores na água, a multidão na praia) vira uma entrada separada nessa lista, com sua própria área e descrição. O modelo recebe o conjunto inteiro e resolve tudo numa única geração, respeitando onde cada elemento deve ficar.

Na prática, isso transforma geração de imagem em algo parecido com montar um layout de interface: em vez de prompt engineering↳Engenharia de prompt6 conteúdosEngenharia de Prompt: a profissão do futuro que vai mudar sua vida (e sua conta bancária)Gestão Dev & TI · abr 2025Melhores técnicas de engenharia de prompt para IAGestão Dev & TI · nov 2024Engenharia de Prompt + Programação: Como Trabalhar com IA na Prática (Com Código Python Integrado)Dev (Back & Front) · abr 2025Ver tudo em AI → para forçar posicionamento, o desenvolvedor passa uma estrutura de dados. É o tipo de input que dá para gerar programaticamente a partir de um template de design, de um layout salvo em banco ou de uma grade de componentes já existente no produto.

O ângulo de agente: quem monta o layout pode ser outro modelo

A Black Forest Labs é direta sobre o caso de uso:

O FLUX 3 Image é treinado nativamente para entender layout e composição de imagem. Um agente pode usar o modelo para criar facilmente imagens bem compostas só com um prompt de texto.

FLUX 3 Image is natively trained to understand image layout and composition. An agent can use the model to easily create well-composed images with just a text prompt.Black Forest Labs, página de produto do FLUX 3 Image

Isso encaixa num padrão de pipeline que já aparece em produtos agentic: um primeiro passo (um agente, ou o próprio modelo) planeja onde cada elemento vai, e a renderização final respeita esse plano. Para quem constrói um agente que gera material de marketing, mockup de produto ou asset de jogo, o ganho é não precisar escrever e manter um prompt gigante tentando descrever espaço, proporção e hierarquia visual ao mesmo tempo.

Render nativo em 4K, sem passo de upscaling

A página mostra exemplos gerados "at full resolution", citando como caso o render "Soba shop, 5456 × 3072 pixels, all from the model" (fonte: bfl.ai/models/flux-3-image). A ressalva "all from the model" importa: não é upscale rodado depois por outro modelo, é a própria geração entregando textura, rosto e cor preservados já na resolução final.

Para quem monta uma esteira de produção de imagem, isso corta uma etapa: hoje é comum gerar em resolução baixa e rodar um modelo de super-resolução separado, com seu próprio custo de GPU e sua própria fila, só para chegar a 4K. Se o FLUX 3 Image sustenta esse resultado nativamente, o pipeline fica mais simples e com menos pontos de falha.

Edição pixel a pixel, caixa por caixa

Além de gerar do zero, o modelo aceita edição direcionada por caixa. A documentação mostra os exemplos "Recolor wetsuit and board, edited box by box, with everything else unchanged" e "Add two divers, before and after a pixel-perfect edit" (fonte: bfl.ai/models/flux-3-image). A lógica é referenciar o id de um elemento específico e pedir uma alteração, mantendo o resto da imagem intacto.

Isso difere de inpainting genérico por máscara livre. Como a imagem já nasce com uma estrutura de elementos nomeados, editar vira uma operação sobre um elemento específico, não sobre uma região recortada à mão. Para catálogo de produto, isso significa gerar variações de cor ou de peça, como no exemplo do traje de mergulho e da prancha, sem recriar fundo, modelo e iluminação inteiros a cada variação.

Até 10 imagens de referência numa composição só

O FLUX 3 Image também aceita até 10 imagens de referência para montar uma composição nova, segundo a página ("Use up to 10 references to create a thoughtfully designed image with less effort"). Os exemplos mostrados, como "Times Square fit" e "Kids room", sugerem uso para moodboard, montagem de lookbook e composição de cena a partir de assets já existentes, sem precisar descrever cada referência em texto corrido.

Licenciamento: pesos comerciais para rodar em infraestrutura própria

Para quem roda geração de imagem em escala, a Black Forest Labs oferece o FLUX 3 Image sob "licença de pesos comerciais" (commercial weights license): a empresa permite fazer fine-tune e deploy do modelo na infraestrutura do próprio cliente, mas o acesso passa por contato comercial direto ("Contact sales"), sem preço público divulgado na página-fonte.

Isso separa dois públicos. Quem quer testar e integrar via API tem os links "Try it" e "Read the docs" como caminho direto. Quem precisa rodar em volume, com controle de custo de GPU e sem depender da API pública da empresa, normalmente é quem tem catálogo de e-commerce↳E-commerce21 conteúdosECBR Club: novo espaço para devs se conectarem ao ecossistema de e-commerceDev (Back & Front) · mai 2025TOTVS anuncia joint venture com VTEXMarketing Tech · mai 2019Jovens da Brasilândia recebem formação gratuita em tecnologiaGestão Dev & TI · jul 2025Ver tudo em Marketing Tech →, publicidade programática ou exigência de que os dados não saiam da própria rede.

O que ainda fica em aberto

A página de produto não traz preço de API, não publica benchmark comparando o FLUX 3 Image a modelos concorrentes nem a versões anteriores da própria família FLUX, e não detalha latência ou custo por imagem nas resoluções mostradas. Quem for avaliar o modelo para produto vai precisar rodar o próprio teste via API antes de decidir entre usar o serviço hospedado ou negociar os pesos comerciais para self-host.

Fonte: Hacker News

Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Mais de Redação iMasters
Ver perfil →
Leia também