Da busca de arquiteturas à geração de arquiteturas

A Busca de Arquiteturas Neurais (NAS) trata o projeto de redes como um problema de otimização: testar candidatas, treiná-las, ficar com a melhor e recomeçar na próxima tarefa. A Geração de Arquiteturas Neurais (NAG) treina, em vez disso, um modelo generativo que aprendeu como são as boas arquiteturas e amostra novas sob demanda. As seções abaixo explicam a diferença com pequenos experimentos que rodam no seu navegador. Abra qualquer seção para lê-la.

Por que automatizar o projeto de arquiteturas?

A estrutura importa, e acertá-la custa caro

Muitos dos resultados marcantes do deep learning vieram de uma arquitetura nova, e não de mais dados ou de um otimizador novo.

Redes convolucionais profundas venceram o ImageNet (Krizhevsky et al., 2017), conexões residuais tornaram treináveis redes muito profundas (He et al., 2016) e a atenção substituiu a recorrência em modelos de sequência (Vaswani et al., 2017). Cada uma delas foi projetada à mão, escolhendo tipos de camada, sua ordem, como se conectam e muitos hiperparâmetros.

O espaço de projeto definido por essas escolhas é enorme e muito estruturado, e explorá-lo por tentativa e erro é lento (Bergstra et al., 2013). À medida que os modelos cresceram, o projeto manual virou um gargalo para escala, reprodutibilidade e reaproveitamento entre tarefas. O passo natural foi deixar um algoritmo explorar.

Esse algoritmo tomou duas formas. A primeira, a busca, procura a melhor arquitetura para uma tarefa. A segunda, a geração, aprende um modelo de boas arquiteturas que pode ser reutilizado.

Busca: a visão do NAS

Projeto de arquiteturas como otimização

A Busca de Arquiteturas Neurais formula o projeto como um problema de otimização discreta sobre um espaço de candidatas definido de antemão por pessoas (Elsken et al., 2019).

Três ingredientes

  • Um espaço de busca: quais arquiteturas são permitidas. Para mantê-lo tratável, muitos métodos buscam só um pequeno motivo repetido, uma célula, e empilham cópias dela para formar a rede completa (Zoph et al., 2018).
  • Uma estratégia de busca: como escolher a próxima candidata. Aprendizado por reforço (Zoph & Le, 2017), evolução (Real et al., 2019), otimização bayesiana (White et al., 2020) e relaxações baseadas em gradiente (Liu et al., 2019) já foram usados.
  • Uma estimativa de desempenho: quão boa é uma candidata, normalmente sua acurácia de validação após o treino, ou um substituto mais barato dela.

Escrito por extenso, o NAS resolve um problema em dois níveis. O nível externo procura a arquitetura \(A\) do espaço de busca \(\mathcal{S}\) com a maior recompensa \(R\). O nível interno treina os pesos \(w\) de cada candidata:

\[ A^* = \arg\max_{A \in \mathcal{S}} R\big(A, w^*(A)\big), \qquad w^*(A) = \arg\min_{w} \mathcal{L}_{\text{train}}(w, A). \]

Cada avaliação de \(R\) esconde um treino completo, e por isso os primeiros NAS custavam milhares de GPU-dias (Real et al., 2017). Compartilhamento de pesos (Pham et al., 2018), treino de baixa fidelidade (Li et al., 2018) e extrapolação de curvas de aprendizado (Domhan et al., 2015) baratearam cada avaliação, mas a avaliação continua com o mesmo papel: uma nota externa que decide quais candidatas sobrevivem.

Experimente: o espaço de busca de brinquedo usado nesta página

Todas as demonstrações desta página usam a mesma célula pequena, no estilo do NAS-Bench-201 (Dong & Yang, 2020). Ela tem quatro nós, e cada uma de suas seis arestas leva uma de cinco operações: nenhuma, conexão direta (skip), convolução 1×1, convolução 3×3 ou pooling médio. São 56 = 15.625 células, poucas o bastante para o navegador pontuar todas. É assim que as demonstrações conseguem mostrar respostas exatas.

A célula, da esquerda para a direita, da entrada à saída. Cada aresta traz o nome da operação. Uma linha tracejada significa "nenhuma", e uma célula sem caminho completo da entrada à saída é degenerada.

Acurácia das 15.625 células na tarefa escolhida. O marcador indica a célula ao lado.

As acurácias vêm de uma função sintética definida à mão, não de dados do NAS-Bench-201. Ela favorece convoluções, profundidade acompanhada de uma conexão direta em paralelo e mais capacidade em tarefas difíceis, e soma um pequeno "ruído" determinístico. A página a usa para ilustrar ideias, não para ranquear métodos.

Os limites da busca

À medida que a área amadureceu, os custos dessa formulação ficaram mais claros (White et al., 2023):

  • O espaço de busca decide o que pode ser encontrado. Um espaço desenhado por pessoas enviesa a descoberta para variações de projetos conhecidos. Dentro de espaços bem desenhados, a busca aleatória é uma referência surpreendentemente forte (Li & Talwalkar, 2020) (Yu et al., 2019), sinal de que boa parte do resultado vem do espaço, e não da estratégia.
  • Cada tarefa nova começa do zero. Uma busca produz uma arquitetura para um conjunto de dados e um orçamento. O conhecimento acumulado no caminho é descartado.
  • A avaliação fica do lado de fora. A nota filtra candidatas, mas nunca vira parte de um modelo reutilizável do que torna uma arquitetura boa.

Esses limites levaram alguns autores a perguntar se o NAS é automação completa ou otimização dentro de fronteiras impostas por pessoas (Baymurzina et al., 2022).

Da busca à geração

Aprender uma distribuição em vez de achar um ponto

A Geração de Arquiteturas Neurais trata arquiteturas como amostras de uma distribuição de probabilidade aprendida \(p_\theta(A)\), e treina um modelo generativo para concentrar a maior parte da probabilidade em bons projetos.

Em vez de um \(\arg\max\), o alvo passa a ser uma distribuição que favorece recompensa alta. Uma escolha conveniente pesa cada arquitetura exponencialmente pela sua recompensa (Soin et al., 2025):

\[ p^*(A) \propto \exp\big(\beta\, R(A)\big). \]

O parâmetro de temperatura \(\beta \ge 0\) controla o quanto a distribuição é seletiva. Com \(\beta = 0\), todas as arquiteturas são igualmente prováveis. Quando \(\beta \to \infty\), toda a massa colapsa na melhor arquitetura, e amostrar de \(p^*\) devolve exatamente a resposta do NAS, \(A^*\). Nesse sentido, o NAS é o limite de temperatura zero da NAG.

Um gerador é então treinado para aproximar esse alvo, \(\min_\theta D\big(p_\theta \,\|\, p^*\big)\) para alguma divergência \(D\). Depois de treinado, ele pode ser condicionado a uma descrição do conjunto de dados \(D\) ou a restrições \(C\), como um orçamento de latência, e amostrar arquiteturas de \(p_\theta(A \mid D, C)\) (Lee et al., 2021) (Lomurno et al., 2024).

Experimente: deslize a temperatura de "vale tudo" até "só a melhor"

Esta demonstração calcula o \(p^*(A)\) exato sobre as 15.625 células enquanto você move o controle.

Massa de probabilidade de \(p^*\) em cada faixa de acurácia (faixas de 0,5 ponto). O marcador tracejado é a melhor célula, \(A^*\).

Resumo de \(p^*\) nesta temperatura
Acurácia esperada
Probabilidade de sortear a melhor célula
Número efetivo de arquiteturas (exponencial da entropia)

O que observar

  • Com β = 0, o histograma mostra apenas como as acurácias se espalham pelo espaço: a maioria das células é mediana.
  • À medida que β cresce, a massa vai para a direita e o número efetivo de arquiteturas cai de milhares para um punhado. Ainda assim é uma distribuição, então várias células boas diferentes mantêm uma parcela.
  • No extremo direito, a distribuição é praticamente toda concentrada em \(A^*\). Isso é o NAS.

Manter uma distribuição em vez de um ponto não é só mais geral. Torna diversidade, incerteza e compromissos visíveis e controláveis, e é o que permite reutilizar o modelo aprendido, como mostra a próxima seção.

Amortização: pagar uma vez, amostrar muitas

Ciclo do NAS versus um gerador treinado

Uma busca paga o custo inteiro a cada tarefa nova. Um gerador paga um custo alto uma única vez, no treino, e depois produz arquiteturas para tarefas novas só com inferência.

Isso é inferência amortizada. A exploração cara de pares arquitetura–desempenho é feita uma vez, em muitas tarefas de treino, e fica guardada nos pesos de um modelo compartilhado \(p_\theta(A \mid D)\). Dado o descritor de um conjunto de dados novo, o modelo propõe arquiteturas em uma passada direta (Lee et al., 2021) (Hemmi et al., 2024). A mesma ideia está por trás das abordagens de implantação do tipo "treine uma vez, especialize muitas" (Cai et al., 2020).

Experimente: uma tarefa nova, buscada versus gerada

As tarefas de brinquedo são descritas por dois números, dificuldade e resolução da entrada, e a melhor arquitetura muda com eles. Quando esta seção abre, um pequeno gerador condicional é treinado em 16 tarefas de treino, com as avaliações de uma busca evolutiva de 300 passos por tarefa, pesadas como em \(p^* \propto \exp(\beta R)\). Depois, escolha qualquer tarefa nova e compare.

O gerador é treinado quando esta seção abre.

  • NAS: melhor acurácia encontrada até agora
  • NAG: melhor de 10 amostras
  • Melhor célula (conhecida aqui por enumeração)
  • NAS: 300 avaliações por tarefa
  • NAG: 4.800 para treinar uma vez, depois 10 por tarefa
Melhor célula encontrada pelo NAS.
Melhor das amostras do gerador.

O que observar

  • Após 300 avaliações, a busca costuma achar a melhor célula. As amostras do gerador chegam perto, em geral a menos de um ponto de acurácia, sem nenhuma busca. Só as 10 amostras são avaliadas, para escolher a melhor delas.
  • O gráfico de custo é a parte honesta. Treinar o gerador custou 4.800 avaliações, então ele só compensa depois de umas 17 tarefas novas. A amortização ajuda quando os problemas de projeto se repetem, não quando há um só.
  • Teste tarefas longe da grade de treino (dificuldade ou resolução perto de 0 ou 1). Um gerador só consegue interpolar o que as tarefas de treino cobriram.

Os três pilares de um gerador

Representação, mecanismo, orientação

Um método de NAG pode ser lido em três eixos interdependentes: como as arquiteturas são representadas, que mecanismo as produz e o que orienta o gerador para as boas.

Representação

Arquiteturas são grafos, em geral grafos acíclicos direcionados de operações. Um gerador precisa de um espaço onde modelá-los. As opções incluem:

  • Codificações discretas, como matrizes de adjacência com rótulos de operação. São exatas, mas difíceis de interpolar.
  • Embeddings latentes contínuos aprendidos por autoencoders de grafos (Zhang et al., 2019) (Li et al., 2020) (Xiang, 2023). São suaves e admitem gradientes, mas decodificar um ponto latente pode gerar um grafo inválido ou repetido.
  • Tokens discretos aprendidos, como códigos vetor-quantizados que um modelo de linguagem pode gerar como sequência (Poddenige et al., 2025).
  • Estrutura probabilística: distribuições sobre os próprios componentes, como a probabilidade de cada operação em cada aresta (Muravev et al., 2021). O gerador da demonstração de amortização é desse tipo.

Diferente de um espaço de busca, que só lista o que é permitido, um espaço de representação modela como as arquiteturas se relacionam. Se essas representações ajudam mesmo sem supervisão é uma questão à parte (Yan et al., 2020).

Mecanismo

Quase todas as famílias de modelos generativos já foram aplicadas a arquiteturas. As quatro minidemonstrações abaixo ilustram as ideias principais no espaço de brinquedo. Cada uma é uma ilustração do princípio, não uma reimplementação dos métodos citados.

Otimização latente: codificar, subir, decodificar

Métodos como o NAO (Luo et al., 2019) embutem as arquiteturas num espaço contínuo, treinam nele um preditor de acurácia, sobem pelo gradiente do preditor e decodificam o resultado. Aqui, o eixo horizontal do mapa 2-D foi ajustado para prever acurácia e o vertical para prever tamanho, a partir de 120 células avaliadas. Cada pixel tem a cor da acurácia real da célula para a qual decodifica.

Clique para escolher um ponto de partida. Eixo horizontal: acurácia prevista. Eixo vertical: tamanho (células maiores para cima). Claro = acurácia real baixa, escuro = alta. Pixels cinza decodificam para uma célula degenerada. O anel marca a melhor célula real.

O que observar: muitos pixels decodificam para a mesma célula, e regiões inteiras decodificam para células degeneradas. É o descompasso entre um espaço contínuo e grafos discretos. A subida também para onde o preditor suave tem seu pico, que não é onde está a melhor célula real.

Difusão: tirar o ruído de uma célula aleatória até virar uma boa

Modelos de difusão aprendem a reverter um processo gradual de adição de ruído (Ho et al., 2020). Aplicados a grafos de arquitetura, um preditor pode guiar a remoção de ruído para acurácia alta (An et al., 2024). Aqui, os dados de treino são um arquivo de 300 células boas, o ruído troca a operação de uma aresta ao acaso e um preditor linear ajustado no arquivo fornece a orientação.

Clique em "Gerar uma" para ver uma célula se formar em 12 passos.

Barras cinza: acurácia das 300 células do arquivo. Depois de "Gerar 300", barras laranja: as células geradas. Os marcadores indicam a melhor célula do arquivo e a melhor célula real.

Lote gerado (veja avaliando um gerador)
Acurácia média / melhor–
Validade–
Unicidade–
Novidade (fora do arquivo)–

O que observar: o removedor exato é o melhor ajuste possível aos dados de treino, mas só consegue reproduzir células do arquivo (novidade 0) (Carlini et al., 2023). O removedor por aresta recombina arestas em células novas e, com orientação, pode chegar a células melhores que qualquer uma do arquivo. Uma orientação mais forte aumenta a acurácia e reduz a unicidade.

GFlowNets: amostrar em proporção à recompensa

Uma Generative Flow Network constrói um objeto passo a passo e é treinada para que objetos completos sejam amostrados com probabilidade proporcional à sua recompensa (Bengio et al., 2026), o que já foi aplicado à geração de arquiteturas (Soin et al., 2025). Aqui, a mesma política constrói uma célula uma aresta por vez, treinada com dois objetivos: aprendizado por reforço, que maximiza a recompensa esperada, e um objetivo de GFlowNet (trajectory balance) com recompensa \(R = \exp(\beta\,\text{acurácia})\).

  • Alvo: proporcional à recompensa
  • GFlowNet
  • Aprendizado por reforço

Clique em "Treinar as duas". O treino roda 200.000 episódios de construção por política.

Depois do treino
GFlowNetAprendizado por reforço
Acurácia esperada––
Número efetivo de arquiteturas––
Células distintas do top 1% em 1.000 amostras––

O que observar: o aprendizado por reforço converge para uma única célula, uma estimativa pontual, como a busca. A GFlowNet mantém probabilidade em muitas células boas, aproximadamente em proporção à recompensa, então suas amostras continuam diversas.

Geração condicionada ao orçamento: um modelo, todos os orçamentos

A implantação acrescenta restrições como tamanho, latência ou energia. Em vez de uma busca por orçamento, geradores cientes de Pareto aprendem \(p_\theta(A \mid \lambda)\) para toda uma faixa de orçamentos \(\lambda\) (Guo et al., 2022) (Lomurno et al., 2024). Aqui, um gerador foi treinado em dez orçamentos. Mova o controle para pedir qualquer orçamento, inclusive os que ele nunca viu.

Cada célula válida (cinza), a fronteira de Pareto exata (linha), o orçamento (tracejado) e 50 amostras do gerador (azul se dentro do orçamento, laranja se acima).

O que observar: as amostras acompanham o orçamento enquanto ele se move, sem retreino e sem busca. Nem toda amostra cabe, porque este gerador pequeno escolhe cada aresta de forma independente, mas o tamanho de uma célula é de graça de calcular, então as amostras acima do orçamento são simplesmente descartadas antes de qualquer treino.

Outras famílias de geradores incluem geradores adversariais (Rezaei et al., 2021), redes de grafos que emitem uma arquitetura inteira em um passo (Agiollo & Omicini, 2022) (Liang & Sun, 2022), variantes de difusão com amostragem evolutiva (Zhou et al., 2025) ou progressiva (Zhang & Zhuang, 2025), e modelos de linguagem ajustados com códigos de arquitetura (Poddenige et al., 2025).

Orientação

O que puxa um gerador para boas arquiteturas? Os estudos se dividem em dois grupos:

  • Guiados por preditor: um modelo substituto estima a acurácia e fornece gradientes ou notas que guiam a geração, como nas demonstrações latente e de difusão acima. O DiffusionNAG é um exemplo (An et al., 2024).
  • Sem preditor: a orientação vem de condicionamento embutido no treino, de priors estruturais ou de avaliações reais convertidas em recompensas, como na demonstração da GFlowNet. Exemplos incluem a orientação sem classificador em difusão de grafos (Asthana et al., 2024) e a geração baseada em GFlowNets (Soin et al., 2025).

Em ambos os casos, o passo que define a mudança do NAS para a NAG é que o sinal de desempenho é internalizado nos parâmetros do gerador, em vez de agir como um filtro externo depois do fato.

Alguns sistemas que propõem e criticam arquiteturas com grandes modelos de linguagem (Rahman & Chakraborty, 2024) (Yang et al., 2025) escapam de espaços de busca fixos, mas ainda dependem de ciclos iterativos de avaliar e refinar, então se comportam mais como busca do que como um modelo generativo aprendido.

Avaliando um gerador

Julgar uma distribuição, não uma única vencedora

Resultados de NAS costumam ser resumidos pela melhor arquitetura encontrada e pelo seu custo. Um gerador produz uma distribuição, e um único número não descreve uma distribuição.

Métricas emprestadas da modelagem generativa

O paradoxo dos benchmarks

Benchmarks tabulares como o NAS-Bench-101 (Ying et al., 2019) e o NAS-Bench-201 (Dong & Yang, 2020) guardam a acurácia treinada de cada arquitetura de um espaço fixo, então qualquer método pode ser pontuado por consulta. Isso dá reprodutibilidade e comparação justa, mas só se o gerador ficar confinado a esse espaço fixo, o que elimina justamente aquilo em que a NAG deveria ser boa: gerar além dele.

As alternativas têm seus próprios problemas. Treinar cada modelo gerado faz os resultados dependerem das receitas de treino (Yang et al., 2020). Pontuar com um preditor substituto importa os vieses do preditor, e um preditor treinado em projetos conhecidos tende a subestimar os novos, a mesma falha encontrada em métricas baseadas em features para imagens (Stein et al., 2023).

Problemas em aberto

Para onde a área está indo

A NAG é jovem, e vários desafios ainda limitam sua confiabilidade e adoção.

Validade por construção

Espaços latentes contínuos e a remoção estocástica de ruído podem produzir grafos que não são redes válidas, então as amostras muitas vezes precisam de reparo ou rejeição. Embutir restrições como aciclicidade e conectividade no próprio processo de geração é uma direção em aberto. Tokens discretos aprendidos são uma primeira tentativa (Poddenige et al., 2025).

Além dos espaços de busca fechados

A maioria dos geradores ainda opera sobre os conjuntos fixos de operações dos espaços de benchmark, então os ganhos podem refletir uma interpolação melhor dentro de uma tabela, e não novos princípios de projeto. Faltam protocolos de avaliação feitos para modelos generativos, que meçam diversidade, transferência e controlabilidade.

Orientação confiável

As paisagens arquitetura–desempenho são grandes e acidentadas, e um único preditor substituto raramente generaliza sobre elas, então os geradores podem acabar otimizando os erros do preditor. Orientação progressiva a partir de conjuntos de preditores mais fracos é uma resposta (Zhang & Zhuang, 2025).

Priors arquiteturais zero-shot

A maioria dos geradores precisa de milhares de arquiteturas avaliadas antes de ser útil. Priors extraídos de benchmarks existentes (Xie et al., 2025) e dinâmicas evolutivas com pouco treino (Zhou et al., 2025) reduzem esse começo a frio. O objetivo de longo prazo é uma distribuição de fundação sobre arquiteturas que funcione entre tarefas.

Explicar os projetos gerados

Arquiteturas geradas raramente vêm com uma justificativa. Ciclos de crítica no estilo de agentes, que justificam cada escolha de projeto (Yang et al., 2025), apontam para geradores cujas decisões podem ser inspecionadas, o que importa para a confiança e para aprender algo com o que eles produzem.

Sobre o estudo

O artigo por trás desta página

Esta página se baseia em From Search to Synthesis: A Systematic Mapping Study of Neural Architecture Generation, de Thiago C. S. Barbieri, Edesio Alcobaça e André C. P. L. F. de Carvalho (Instituto de Ciências Matemáticas e de Computação, Universidade de São Paulo). O manuscrito está atualmente em revisão, e um link será adicionado aqui quando for publicado.

A página se apoia na formulação e na bibliografia do estudo. As demonstrações e todos os seus números foram feitos para esta página.

Referências

Todos os trabalhos citados nesta página
  1. Agiollo, A., Omicini, A. (2022). GNN2GNN: Graph neural networks to generate neural networks. Proceedings of the Thirty-Eighth Conference on Uncertainty in Artificial Intelligence 180, 32–42. link Citado em: Os três pilares de um gerador
  2. An, S., Lee, H., Jo, J., Lee, S., Hwang, S. J. (2024). DiffusionNAG: Predictor-guided Neural Architecture Generation with Diffusion Models. arXiv preprint. doi:10.48550/arXiv.2305.16943 Citado em: Os três pilares de um gerador
  3. Asthana, R., Conrad, J., Dawoud, Y., Ortmanns, M., Belagiannis, V. (2024). Multi-conditioned Graph Diffusion for Neural Architecture Search. arXiv preprint. doi:10.48550/arXiv.2403.06020 Citado em: Os três pilares de um gerador
  4. Baymurzina, D., Golikov, E., Burtsev, M. (2022). A review of neural architecture search. Neurocomputing 474, 82–93. doi:10.1016/j.neucom.2021.12.014 Citado em: Busca: a visão do NAS
  5. Bengio, Y., Lahlou, S., Deleu, T., Hu, E. J., Tiwari, M., Bengio, E. (2026). GFlowNet Foundations. arXiv preprint. link Citado em: Os três pilares de um gerador
  6. Bergstra, J., Yamins, D., Cox, D. (2013). Making a Science of Model Search: Hyperparameter Optimization in Hundreds of Dimensions for Vision Architectures. Proceedings of the 30th International Conference on Machine Learning 28, 115–123. link Citado em: Por que automatizar o projeto de arquiteturas?
  7. Betzalel, E., Penso, C., Navon, A., Fetaya, E. (2022). A Study on the Evaluation of Generative Models. arXiv preprint. link Citado em: Avaliando um gerador
  8. Cai, H., Gan, C., Wang, T., Zhang, Z., Han, S. (2020). Once-for-All: Train One Network and Specialize it for Efficient Deployment. arXiv preprint. link Citado em: Amortização: pagar uma vez, amostrar muitas
  9. Carlini, N., Hayes, J., Nasr, M., Jagielski, M., Sehwag, V., Tramèr, F., Balle, B., Ippolito, D., Wallace, E. (2023). Extracting Training Data from Diffusion Models. arXiv preprint. link Citado em: Os três pilares de um gerador
  10. Domhan, T., Springenberg, J. T., Hutter, F. (2015). Speeding up automatic hyperparameter optimization of deep neural networks by extrapolation of learning curves. Proceedings of the 24th International Conference on Artificial Intelligence , 3460–3468. link Citado em: Busca: a visão do NAS
  11. Dong, X., Yang, Y. (2020). NAS-Bench-201: Extending the Scope of Reproducible Neural Architecture Search. arXiv preprint. link Citado em: Busca: a visão do NAS, Avaliando um gerador
  12. Elsken, T., Metzen, J. H., Hutter, F. (2019). Neural architecture search: a survey. J. Mach. Learn. Res. 20(1), 1997–2017. Citado em: Busca: a visão do NAS
  13. Guo, Y., Chen, Y., Zheng, Y., Chen, Q., Zhao, P., Chen, J., Huang, J., Tan, M. (2022). Pareto-aware Neural Architecture Generation for Diverse Computational Budgets. arXiv preprint. link Citado em: Os três pilares de um gerador, Problemas em aberto
  14. He, K., Zhang, X., Ren, S., Sun, J. (2016). Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , 770–778. doi:10.1109/CVPR.2016.90 Citado em: Por que automatizar o projeto de arquiteturas?
  15. Ho, J., Jain, A., Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. arXiv preprint. link Citado em: Os três pilares de um gerador
  16. Krizhevsky, A., Sutskever, I., Hinton, G. E. (2017). ImageNet classification with deep convolutional neural networks. Commun. ACM 60(6), 84–90. doi:10.1145/3065386 Citado em: Por que automatizar o projeto de arquiteturas?
  17. Kynkäänniemi, T., Karras, T., Laine, S., Lehtinen, J., Aila, T. (2019). Improved Precision and Recall Metric for Assessing Generative Models. arXiv preprint. link Citado em: Avaliando um gerador
  18. Lee, H., Hyung, E., Hwang, S. J. (2021). Rapid Neural Architecture Search by Learning to Generate Graphs from Datasets. arXiv preprint. link Citado em: Da busca à geração, Amortização: pagar uma vez, amostrar muitas
  19. Li, J., Liu, Y., Liu, J., Wang, W. (2020). Neural Architecture Optimization with Graph VAE. arXiv preprint. link Citado em: Os três pilares de um gerador
  20. Li, L., Jamieson, K., DeSalvo, G., Rostamizadeh, A., Talwalkar, A. (2018). Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization. arXiv preprint. link Citado em: Busca: a visão do NAS
  21. Li, L., Talwalkar, A. (2020). Random Search and Reproducibility for Neural Architecture Search. Proceedings of The 35th Uncertainty in Artificial Intelligence Conference 115, 367–377. link Citado em: Busca: a visão do NAS
  22. Liang, Z., Sun, Y. (2022). Automating Neural Architecture Design without Search. arXiv preprint. doi:10.48550/arXiv.2204.11838 Citado em: Os três pilares de um gerador
  23. Liu, H., Simonyan, K., Yang, Y. (2019). DARTS: Differentiable Architecture Search. arXiv preprint. link Citado em: Busca: a visão do NAS
  24. Lomurno, E., Mariani, S., Monti, M., Matteucci, M. (2024). POMONAG: Pareto-Optimal Many-Objective Neural Architecture Generator. arXiv preprint. doi:10.48550/arXiv.2409.20447 Citado em: Da busca à geração, Os três pilares de um gerador, Problemas em aberto
  25. Lukasik, J., Jung, S., Keuper, M. (2022). Learning Where to Look – Generative NAS is Surprisingly Efficient. Computer Vision – ECCV 2022 , 257–273. Citado em: Avaliando um gerador
  26. Luo, R., Tian, F., Qin, T., Chen, E., Liu, T.-Y. (2019). Neural Architecture Optimization. arXiv preprint. doi:10.48550/arXiv.1808.07233 Citado em: Os três pilares de um gerador
  27. Muravev, A., Raitoharju, J., Gabbouj, M. (2021). Neural Architecture Search by Estimation of Network Structure Distributions. IEEE Access 9, 15304–15319. doi:10.1109/ACCESS.2021.3052996 Citado em: Os três pilares de um gerador
  28. Naeem, M. F., Oh, S. J., Uh, Y., Choi, Y., Yoo, J. (2020). Reliable fidelity and diversity metrics for generative models. Proceedings of the 37th International Conference on Machine Learning (ICML). Citado em: Avaliando um gerador
  29. Pham, H., Guan, M., Zoph, B., Le, Q., Dean, J. (2018). Efficient Neural Architecture Search via Parameters Sharing. Proceedings of the 35th International Conference on Machine Learning 80, 4095–4104. link Citado em: Busca: a visão do NAS
  30. Poddenige, D. G., Seneviratne, S., Senanayake, D., Niranjan, M., Suganthan, P. N., Halgamuge, S. (2025). Arch-LLM: Taming LLMs for Neural Architecture Generation via Unsupervised Discrete Representation Learning. arXiv preprint. doi:10.48550/arXiv.2503.22063 Citado em: Os três pilares de um gerador, Avaliando um gerador, Problemas em aberto
  31. Rahman, M. H., Chakraborty, P. (2024). LeMo-NADe: Multi-Parameter Neural Architecture Discovery with LLMs. arXiv preprint. link Citado em: Os três pilares de um gerador
  32. Real, E., Moore, S., Selle, A., Saxena, S., Suematsu, Y. L., Tan, J., Le, Q., Kurakin, A. (2017). Large-Scale Evolution of Image Classifiers. arXiv preprint. link Citado em: Busca: a visão do NAS
  33. Real, E., Aggarwal, A., Huang, Y., Le, Q. V. (2019). Regularized evolution for image classifier architecture search. Proceedings of the AAAI Conference on Artificial Intelligence. doi:10.1609/aaai.v33i01.33014780 Citado em: Busca: a visão do NAS
  34. Rezaei, S. S. C., Han, F. X., Niu, D., Salameh, M., Mills, K., Lian, S., Lu, W., Jui, S. (2021). Generative Adversarial Neural Architecture Search. arXiv preprint. doi:10.48550/arXiv.2105.09356 Citado em: Os três pilares de um gerador
  35. Sajjadi, M. S. M., Bachem, O., Lucic, M., Bousquet, O., Gelly, S. (2018). Assessing Generative Models via Precision and Recall. arXiv preprint. link Citado em: Avaliando um gerador
  36. Soin, H., Tripura, T., Chakraborty, S. (2025). Generative flow induced neural architecture search: Towards discovering optimal architecture in wavelet neural operator. Computer Physics Communications 316, 109755. doi:10.1016/j.cpc.2025.109755 Citado em: Da busca à geração, Os três pilares de um gerador, Avaliando um gerador
  37. Stein, G., Cresswell, J. C., Hosseinzadeh, R., Sui, Y., Ross, B. L., Villecroze, V., Liu, Z., Caterini, A. L., Taylor, J. E. T., Loaiza-Ganem, G. (2023). Exposing flaws of generative model evaluation metrics and their unfair treatment of diffusion models. arXiv preprint. link Citado em: Avaliando um gerador
  38. Theis, L., van den Oord, A., Bethge, M. (2016). A note on the evaluation of generative models. arXiv preprint. link Citado em: Avaliando um gerador
  39. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., Polosukhin, I. (2017). Attention is all you need. Proceedings of the 31st International Conference on Neural Information Processing Systems , 6000–6010. Citado em: Por que automatizar o projeto de arquiteturas?
  40. White, C., Neiswanger, W., Savani, Y. (2020). BANANAS: Bayesian Optimization with Neural Architectures for Neural Architecture Search. arXiv preprint. link Citado em: Busca: a visão do NAS
  41. White, C., Safari, M., Sukthanker, R., Ru, B., Elsken, T., Zela, A., Dey, D., Hutter, F. (2023). Neural Architecture Search: Insights from 1000 Papers. arXiv preprint. link Citado em: Busca: a visão do NAS
  42. Xiang, L. (2023). Efficient Automated Neural Architecture Design. PhD thesis, University of Warwick. link Citado em: Os três pilares de um gerador
  43. Xie, J., Ji, H., Sun, Y. (2025). Prior Knowledge Guided Neural Architecture Generation. Proceedings of the 42nd International Conference on Machine Learning 267, 68671–68686. link Citado em: Problemas em aberto
  44. Yan, S., Zheng, Y., Ao, W., Zeng, X., Zhang, M. (2020). Does Unsupervised Architecture Representation Learning Help Neural Architecture Search?. arXiv preprint. link Citado em: Os três pilares de um gerador
  45. Yang, A., Esperança, P. M., Carlucci, F. M. (2020). NAS evaluation is frustratingly hard. arXiv preprint. link Citado em: Avaliando um gerador
  46. Yang, Z., Zeng, W., Jin, S., Qian, C., Luo, P., Liu, W. (2025). NADER: Neural Architecture Design via Multi-Agent Collaboration. 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , 4452–4461. doi:10.1109/CVPR52734.2025.00420 Citado em: Os três pilares de um gerador, Problemas em aberto
  47. Ying, C., Klein, A., Real, E., Christiansen, E., Murphy, K., Hutter, F. (2019). NAS-Bench-101: Towards Reproducible Neural Architecture Search. arXiv preprint. link Citado em: Avaliando um gerador
  48. Yu, K., Sciuto, C., Jaggi, M., Musat, C., Salzmann, M. (2019). Evaluating the Search Phase of Neural Architecture Search. arXiv preprint. link Citado em: Busca: a visão do NAS
  49. Zhang, M., Jiang, S., Cui, Z., Garnett, R., Chen, Y. (2019). D-VAE: a variational autoencoder for directed acyclic graphs. Proceedings of the 33rd International Conference on Neural Information Processing Systems , 1588–1600. Citado em: Os três pilares de um gerador, Avaliando um gerador
  50. Zhang, Z., Zhuang, L. (2025). Progressive Neural Architecture Generation with Weaker Predictors. MultiMedia Modeling , 229–242. doi:10.1007/978-981-96-2064-7_17 Citado em: Os três pilares de um gerador, Problemas em aberto
  51. Zhou, B., Yu, C., Tang, C. (2025). Evolution Meets Diffusion: Efficient Neural Architecture Generation. arXiv preprint. doi:10.48550/arXiv.2504.17827 Citado em: Os três pilares de um gerador, Problemas em aberto
  52. Zoph, B., Le, Q. V. (2017). Neural Architecture Search with Reinforcement Learning. arXiv preprint. link Citado em: Busca: a visão do NAS
  53. Zoph, B., Vasudevan, V., Shlens, J., Le, Q. V. (2018). Learning Transferable Architectures for Scalable Image Recognition. arXiv preprint. link Citado em: Busca: a visão do NAS