Meta lança Muse Image e revela prévia do Muse Video com inteligência artificial avançada

Meta Ai

Meta Ai - JRdes / Shutterstock.com

A Meta anunciou o lançamento do Muse Image e apresentou uma prévia do Muse Video, os primeiros modelos de geração de mídia desenvolvidos pelo Meta Superintelligence Labs. Essas novas ferramentas representam um avanço significativo na criação de conteúdo visual e audiovisual.

O Muse Image, considerado o modelo mais sofisticado da empresa até o momento, destaca-se por sua capacidade de seguir instruções com precisão, realizar edições detalhadas, compor elementos a partir de múltiplas referências e utilizar o Instagram para contexto social. Além disso, oferece recursos interativos de uso de ferramentas e se integra ao Muse Spark, enquanto o Muse Video, construído sobre a mesma base de pré-treinamento, promete uma excepcional fidelidade visual com suporte nativo a áudio.

Em termos de disponibilidade, o Muse Image já pode ser acessado no aplicativo Meta AI, na plataforma meta.ai, nos Stories do Instagram para usuários nos Estados Unidos e no WhatsApp em alguns países. Em breve, estará disponível também no Facebook. O Muse Video será lançado em breve para criadores de conteúdo e no Meta AI.

Geração de imagens agenciais com Muse Image

Em vez de simplesmente converter instruções em imagens, o Muse Image funciona como um agente inteligente. Ele invoca ferramentas de busca e codificação para refinar a precisão, aprimora suas próprias gerações e otimiza seu desempenho ao escalar o poder computacional durante os testes. Sua integração com o Muse Spark permite que ambos os modelos compartilhem ferramentas e planejem juntos, proporcionando uma poderosa capacidade de geração de mídia agencial.

Capacidade de uso de ferramentas

O Muse Image tem acesso a diversas ferramentas que potencializam suas capacidades de atuação. Ele aprendeu, por meio de aprendizado por reforço, a escrever e executar códigos para produzir gráficos e códigos QR precisos, condicionando-se às figuras renderizadas para melhorar a acurácia das imagens geradas. A combinação com o Muse Spark permite a criação de GIFs animados, sites com imagens incorporadas e jogos visuais interativos.

Um exemplo notável de sua capacidade de programação é a criação de um código QR legível dentro de uma ilustração complexa no estilo manhwa coreano, assegurando que o código funcione corretamente enquanto se integra artisticamente à cena. O modelo também é capaz de gerar gráficos fractais detalhados, como conjuntos de Julia e triângulos de Sierpinski, e aplicá-los em layouts de pôsteres com estilos específicos.

Na área de animação, o Muse Image demonstra a criação de sequências de flipbook. Ele aprimora os detalhes dos personagens, ajusta suas posições para gerar interações dinâmicas, como um golpe de soco e um movimento de esquiva, mantendo a consistência do cenário e da iluminação em cada quadro. Outra aplicação envolve a criação de diferentes fases de vida de um animal de estimação, como um gato persa creme transformado em gatinho recém-nascido ou em adolescente esguio, para uso em jogos visuais, convertendo as imagens em URIs de dados para carregamento instantâneo.

Além da programação, a funcionalidade de pesquisa permite que o Muse Image consulte a web para fundamentar imagens geradas com informações factuais e em tempo real, bem como referências visuais. Essa capacidade é crucial para melhorar a precisão em solicitações que exigem conhecimento prévio, especialmente sobre eventos atuais e fatos do mundo real.

A ferramenta de pesquisa foi utilizada para identificar tendências de moda para o verão de 2026, analisando relatórios de desfiles e catálogos de produtos para gerar links de compra e sugestões de looks. No campo da ciência, o modelo pesquisou diagramas e fontes confiáveis sobre a hipótese do impacto gigante para elaborar infográficos precisos e visualmente consistentes sobre a formação da Lua. Em outra demonstração, o Muse Image planejou e selecionou itens vintage sem marca no Facebook Marketplace em São Francisco, combinando-os com o estilo de decoração aconchegante e simples de um quarto.

Autoaperfeiçoamento e reflexão do modelo

Uma das características emergentes do Muse Image é sua capacidade de autoaperfeiçoamento. O modelo reflete sobre seu próprio trabalho e o aprimora dentro de sua linha de raciocínio, seja realizando edições locais para pequenos erros ou gerando uma imagem totalmente nova quando há falhas maiores. Esse comportamento surgiu durante o treinamento por aprendizado por reforço, pois resultou em imagens de melhor qualidade e, consequentemente, recompensas maiores.

Em exemplos de autoaperfeiçoamento, o modelo demonstrou a capacidade de montar uma página de revista, integrando etapas de revisão, título e retrato de moda com um layout coeso e detalhes impecáveis. Outra ilustração envolve a correção de fórmulas matemáticas, ajustando o layout e verificando a clareza do texto. O processo também incluiu a revisão final de imagens geradas, confirmando detalhes macro, acabamento brilhante e precisão antes de compartilhar.

Escalabilidade e eficiência computacional

Assim como ocorre com os modelos de linguagem, o Muse Image melhora progressivamente quanto mais informações processa durante a inferência. Com um maior poder computacional em tempo de teste, o modelo aprofunda seu raciocínio, faz mais chamadas de ferramentas e emprega mais etapas de autoaperfeiçoamento para refinar suas gerações. O aumento da capacidade de raciocínio e do poder computacional resulta em melhorias nas pontuações Elo de preferência humana, demonstrando uma relação de escala aproximadamente log-linear.

Estudos revelaram que o uso criterioso do orçamento de tokens é essencial para uma escalabilidade eficaz. Enquanto o método Best-of-N (que gera várias imagens e seleciona a melhor) melhora a qualidade inicialmente, ele satura rapidamente. Por outro lado, o investimento desse mesmo poder computacional em raciocínio deliberado proporciona uma escalabilidade significativamente melhor. O raciocínio e o uso de ferramentas se potencializam mutuamente, permitindo que o modelo vá além de seu conhecimento prévio, seja buscando referências ou escrevendo códigos para detalhes precisos, preenchendo lacunas que o raciocínio sozinho não conseguiria suprir.

Edição precisa de imagens

O Muse Image demonstra uma capacidade de edição de imagens com precisão, alterando exatamente o que o usuário solicita em uma variedade de instruções. Ele pode, por exemplo, dissipar a névoa de uma imagem para revelar um vale, modificar as pétalas de uma flor para formar um degradê de arco-íris, ou alterar textos e números em uma placa, além de ajustar o zoom para contextualizar uma cena.

O modelo também mantém a coerência ao longo das etapas de edição, facilitando o refinamento iterativo e a experimentação aberta para alcançar um resultado desejado. Em uma demonstração, ele foi capaz de transformar uma sala de estar para o estilo Japandi, utilizando elementos específicos de outras imagens. Outro exemplo complexo incluiu a composição de um piquenique entre um gato e um cachorro, imaginando-o depois como uma foto emoldurada em um café, e, por fim, gerando o cardápio do estabelecimento com um item temático e ilustração dos animais.

Criação de composições com múltiplas referências

A capacidade do Muse Image se estende à composição de elementos a partir de diversas imagens de referência inseridas no prompt, incluindo pessoas, objetos, roupas, estilos e ambientes. O modelo suporta a intercalação de texto e imagens diretamente no prompt para criações visuais complexas.

Isso é demonstrado pela composição de uma imagem de uma pessoa andando de bicicleta, usando roupas e sentada em um banco de parque, tudo com um estilo de desenho específico, a partir de múltiplas referências visuais. Em outro caso, o modelo conseguiu mudar a cor de uma sala de estar para um padrão específico na parede, adicionando uma mesa de centro, aparador e uma televisão de 65 polegadas com uma imagem específica na tela, e inserindo uma pessoa sentada no sofá com itens específicos.

Atualmente, o Muse Image ocupa a segunda posição no Arena em conversão de texto em imagem, edição de imagem única e edição de múltiplas imagens, conforme as classificações Elo de preferência humana mais recentes.