InstructPix2Pix
InstructPix2Pix edita uma foto a partir de uma instrução em linguagem simples, como "faça o céu ficar laranja de pôr do sol" ou "transforme isso em uma aquarela." Você fornece uma imagem de entrada e um comando de texto curto, e o modelo retorna uma versão editada em segundos sem precisar treinar nessa foto específica antes. Foi publicado como um Destaque do CVPR 2023 por pesquisadores da UC Berkeley.
Editores baseados em máscara exigem que você pinte regiões antes de alterar qualquer coisa. InstructPix2Pix executa uma única passagem direta apenas a partir do texto, pulando etapas de ajuste fino ou inversão por imagem que retardam outros fluxos de trabalho de edição por difusão. A compensação aparece nos casos de falha do artigo: mudanças de ponto de vista, troca de objetos e edições locais precisas continuam sendo pontos fracos.
O projeto disponibiliza código open source no GitHub e um espaço de demonstração no Hugging Face para testar edições no navegador. O treinamento combinou GPT-3 e Stable Diffusion para sintetizar pares de instruções, e o modelo lançado generaliza para fotos reais de até cerca de 768 pixels de largura, apesar da resolução de treinamento de 256x256.
Edita uma imagem carregada a partir de uma instrução escrita sem máscara manual ou ajuste fino por imagem
Executa edições em uma passagem direta e retorna resultados em segundos ao invés de workflows de inversão de minutos
Generaliza para fotos reais de até cerca de 768 pixels de largura apesar da resolução de treinamento de 256x256
Código de código aberto no github.com/timothybrooks/instruct-pix2pix com um espaço de demonstração Hugging Face
Permite instruções encadeadas onde múltiplas edições sequenciais se acumulam na mesma foto
Edita fotos a partir de instruções de texto sem desenhar máscaras ou ajustar finamente em cada imagem
Lançamento de código aberto com uma demonstração gratuita no Hugging Face reduz a barreira para testar edições
Inferência de passagem direta completa as edições em segundos em configurações de hardware de consumo
Não consegue alterar de forma confiável o ponto de vista da câmera ou trocar objetos dentro de uma cena
Às vezes aplica mudanças mais amplas do que a instrução pretendia
O site do projeto é uma página de pesquisa, não um editor hospedado com suporte contínuo ao produto
O que é o InstructPix2Pix?
InstructPix2Pix é um modelo de difusão condicional que edita imagens a partir de instruções escritas por humanos. InstructPix2Pix recebe uma foto de entrada mais um comando de texto e retorna uma imagem editada em segundos.
O InstructPix2Pix é gratuito?
Sim. InstructPix2Pix é uma versão de pesquisa gratuita com código aberto no GitHub e uma demonstração pública no Hugging Face. InstructPix2Pix não possui assinatura paga nem página de preços comerciais em seu site do projeto.
Como o InstructPix2Pix funciona?
InstructPix2Pix foi treinado com pares de edição de imagem gerados pela combinação do GPT-3 e Stable Diffusion. No momento da inferência, InstructPix2Pix segue sua instrução escrita em uma única passagem direta, sem ajuste fino por exemplo.
Onde posso testar o InstructPix2Pix?
Você pode usar o InstructPix2Pix no Hugging Face Space em timbrooks/instruct-pix2pix ou baixar o código no GitHub. InstructPix2Pix fornece ambos os links na página inicial do projeto.
Quais são as limitações do InstructPix2Pix?
InstructPix2Pix tem dificuldades com mudanças de ponto de vista, edições excessivas não intencionais, isolar objetos específicos e trocar objetos dentro de uma cena. InstructPix2Pix documenta esses modos de falha em sua página de resultados.
Quem criou o InstructPix2Pix?
InstructPix2Pix foi criado por Tim Brooks, Aleksander Holynski e Alexei A. Efros na UC Berkeley. InstructPix2Pix foi apresentado como um artigo destaque no CVPR 2023 com links para código e demonstração no site do projeto.

