Da busca de arquiteturas à geração de arquiteturas
A Busca de Arquiteturas Neurais (NAS) trata o projeto de redes como um problema de otimização: testar candidatas, treiná-las, ficar com a melhor e recomeçar na próxima tarefa. A Geração de Arquiteturas Neurais (NAG) treina, em vez disso, um modelo generativo que aprendeu como são as boas arquiteturas e amostra novas sob demanda. As seções abaixo explicam a diferença com pequenos experimentos que rodam no seu navegador. Abra qualquer seção para lê-la.
Por que automatizar o projeto de arquiteturas?
A estrutura importa, e acertá-la custa caro
Muitos dos resultados marcantes do deep learning vieram de uma arquitetura nova, e não de mais dados ou de um otimizador novo.
Redes convolucionais profundas venceram o ImageNet (Krizhevsky et al., 2017), conexões residuais tornaram treináveis redes muito profundas (He et al., 2016) e a atenção substituiu a recorrência em modelos de sequência (Vaswani et al., 2017). Cada uma delas foi projetada à mão, escolhendo tipos de camada, sua ordem, como se conectam e muitos hiperparâmetros.
O espaço de projeto definido por essas escolhas é enorme e muito estruturado, e explorá-lo por tentativa e erro é lento (Bergstra et al., 2013). À medida que os modelos cresceram, o projeto manual virou um gargalo para escala, reprodutibilidade e reaproveitamento entre tarefas. O passo natural foi deixar um algoritmo explorar.
Esse algoritmo tomou duas formas. A primeira, a busca, procura a melhor arquitetura para uma tarefa. A segunda, a geração, aprende um modelo de boas arquiteturas que pode ser reutilizado.
Busca: a visão do NAS
Projeto de arquiteturas como otimização
A Busca de Arquiteturas Neurais formula o projeto como um problema de otimização discreta sobre um espaço de candidatas definido de antemão por pessoas (Elsken et al., 2019).
Três ingredientes
Um espaço de busca: quais arquiteturas são permitidas. Para mantê-lo tratável, muitos métodos buscam só um pequeno motivo repetido, uma célula, e empilham cópias dela para formar a rede completa (Zoph et al., 2018).
Uma estimativa de desempenho: quão boa é uma candidata, normalmente sua acurácia de validação após o treino, ou um substituto mais barato dela.
Escrito por extenso, o NAS resolve um problema em dois níveis. O nível externo procura a arquitetura \(A\) do espaço de busca \(\mathcal{S}\) com a maior recompensa \(R\). O nível interno treina os pesos \(w\) de cada candidata:
Cada avaliação de \(R\) esconde um treino completo, e por isso os primeiros NAS custavam milhares de GPU-dias (Real et al., 2017). Compartilhamento de pesos (Pham et al., 2018), treino de baixa fidelidade (Li et al., 2018) e extrapolação de curvas de aprendizado (Domhan et al., 2015) baratearam cada avaliação, mas a avaliação continua com o mesmo papel: uma nota externa que decide quais candidatas sobrevivem.
Experimente: o espaço de busca de brinquedo usado nesta página
Todas as demonstrações desta página usam a mesma célula pequena, no estilo do NAS-Bench-201 (Dong & Yang, 2020). Ela tem quatro nós, e cada uma de suas seis arestas leva uma de cinco operações: nenhuma, conexão direta (skip), convolução 1×1, convolução 3×3 ou pooling médio. São 56 = 15.625 células, poucas o bastante para o navegador pontuar todas. É assim que as demonstrações conseguem mostrar respostas exatas.
A célula, da esquerda para a direita, da entrada à saída. Cada aresta traz o nome da operação. Uma linha tracejada significa "nenhuma", e uma célula sem caminho completo da entrada à saída é degenerada.
Acurácia das 15.625 células na tarefa escolhida. O marcador indica a célula ao lado.
As acurácias vêm de uma função sintética definida à mão, não de dados do NAS-Bench-201. Ela favorece convoluções, profundidade acompanhada de uma conexão direta em paralelo e mais capacidade em tarefas difíceis, e soma um pequeno "ruído" determinístico. A página a usa para ilustrar ideias, não para ranquear métodos.
Os limites da busca
À medida que a área amadureceu, os custos dessa formulação ficaram mais claros (White et al., 2023):
O espaço de busca decide o que pode ser encontrado. Um espaço desenhado por pessoas enviesa a descoberta para variações de projetos conhecidos. Dentro de espaços bem desenhados, a busca aleatória é uma referência surpreendentemente forte (Li & Talwalkar, 2020)(Yu et al., 2019), sinal de que boa parte do resultado vem do espaço, e não da estratégia.
Cada tarefa nova começa do zero. Uma busca produz uma arquitetura para um conjunto de dados e um orçamento. O conhecimento acumulado no caminho é descartado.
A avaliação fica do lado de fora. A nota filtra candidatas, mas nunca vira parte de um modelo reutilizável do que torna uma arquitetura boa.
Esses limites levaram alguns autores a perguntar se o NAS é automação completa ou otimização dentro de fronteiras impostas por pessoas (Baymurzina et al., 2022).
Da busca à geração
Aprender uma distribuição em vez de achar um ponto
A Geração de Arquiteturas Neurais trata arquiteturas como amostras de uma distribuição de probabilidade aprendida \(p_\theta(A)\), e treina um modelo generativo para concentrar a maior parte da probabilidade em bons projetos.
Em vez de um \(\arg\max\), o alvo passa a ser uma distribuição que favorece recompensa alta. Uma escolha conveniente pesa cada arquitetura exponencialmente pela sua recompensa (Soin et al., 2025):
\[ p^*(A) \propto \exp\big(\beta\, R(A)\big). \]
O parâmetro de temperatura \(\beta \ge 0\) controla o quanto a distribuição é seletiva. Com \(\beta = 0\), todas as arquiteturas são igualmente prováveis. Quando \(\beta \to \infty\), toda a massa colapsa na melhor arquitetura, e amostrar de \(p^*\) devolve exatamente a resposta do NAS, \(A^*\). Nesse sentido, o NAS é o limite de temperatura zero da NAG.
Um gerador é então treinado para aproximar esse alvo, \(\min_\theta D\big(p_\theta \,\|\, p^*\big)\) para alguma divergência \(D\). Depois de treinado, ele pode ser condicionado a uma descrição do conjunto de dados \(D\) ou a restrições \(C\), como um orçamento de latência, e amostrar arquiteturas de \(p_\theta(A \mid D, C)\) (Lee et al., 2021)(Lomurno et al., 2024).
Experimente: deslize a temperatura de "vale tudo" até "só a melhor"
Esta demonstração calcula o \(p^*(A)\) exato sobre as 15.625 células enquanto você move o controle.
Massa de probabilidade de \(p^*\) em cada faixa de acurácia (faixas de 0,5 ponto). O marcador tracejado é a melhor célula, \(A^*\).
Resumo de \(p^*\) nesta temperatura
Acurácia esperada
Probabilidade de sortear a melhor célula
Número efetivo de arquiteturas (exponencial da entropia)
O que observar
Com β = 0, o histograma mostra apenas como as acurácias se espalham pelo espaço: a maioria das células é mediana.
À medida que β cresce, a massa vai para a direita e o número efetivo de arquiteturas cai de milhares para um punhado. Ainda assim é uma distribuição, então várias células boas diferentes mantêm uma parcela.
No extremo direito, a distribuição é praticamente toda concentrada em \(A^*\). Isso é o NAS.
Manter uma distribuição em vez de um ponto não é só mais geral. Torna diversidade, incerteza e compromissos visíveis e controláveis, e é o que permite reutilizar o modelo aprendido, como mostra a próxima seção.
Amortização: pagar uma vez, amostrar muitas
Ciclo do NAS versus um gerador treinado
Uma busca paga o custo inteiro a cada tarefa nova. Um gerador paga um custo alto uma única vez, no treino, e depois produz arquiteturas para tarefas novas só com inferência.
Isso é inferência amortizada. A exploração cara de pares arquitetura–desempenho é feita uma vez, em muitas tarefas de treino, e fica guardada nos pesos de um modelo compartilhado \(p_\theta(A \mid D)\). Dado o descritor de um conjunto de dados novo, o modelo propõe arquiteturas em uma passada direta (Lee et al., 2021)(Hemmi et al., 2024). A mesma ideia está por trás das abordagens de implantação do tipo "treine uma vez, especialize muitas" (Cai et al., 2020).
Experimente: uma tarefa nova, buscada versus gerada
As tarefas de brinquedo são descritas por dois números, dificuldade e resolução da entrada, e a melhor arquitetura muda com eles. Quando esta seção abre, um pequeno gerador condicional é treinado em 16 tarefas de treino, com as avaliações de uma busca evolutiva de 300 passos por tarefa, pesadas como em \(p^* \propto \exp(\beta R)\). Depois, escolha qualquer tarefa nova e compare.
O gerador é treinado quando esta seção abre.
NAS: melhor acurácia encontrada até agora
NAG: melhor de 10 amostras
Melhor célula (conhecida aqui por enumeração)
NAS: 300 avaliações por tarefa
NAG: 4.800 para treinar uma vez, depois 10 por tarefa
Melhor célula encontrada pelo NAS.Melhor das amostras do gerador.
O que observar
Após 300 avaliações, a busca costuma achar a melhor célula. As amostras do gerador chegam perto, em geral a menos de um ponto de acurácia, sem nenhuma busca. Só as 10 amostras são avaliadas, para escolher a melhor delas.
O gráfico de custo é a parte honesta. Treinar o gerador custou 4.800 avaliações, então ele só compensa depois de umas 17 tarefas novas. A amortização ajuda quando os problemas de projeto se repetem, não quando há um só.
Teste tarefas longe da grade de treino (dificuldade ou resolução perto de 0 ou 1). Um gerador só consegue interpolar o que as tarefas de treino cobriram.
Os três pilares de um gerador
Representação, mecanismo, orientação
Um método de NAG pode ser lido em três eixos interdependentes: como as arquiteturas são representadas, que mecanismo as produz e o que orienta o gerador para as boas.
Representação
Arquiteturas são grafos, em geral grafos acíclicos direcionados de operações. Um gerador precisa de um espaço onde modelá-los. As opções incluem:
Codificações discretas, como matrizes de adjacência com rótulos de operação. São exatas, mas difíceis de interpolar.
Embeddings latentes contínuos aprendidos por autoencoders de grafos (Zhang et al., 2019)(Li et al., 2020)(Xiang, 2023). São suaves e admitem gradientes, mas decodificar um ponto latente pode gerar um grafo inválido ou repetido.
Tokens discretos aprendidos, como códigos vetor-quantizados que um modelo de linguagem pode gerar como sequência (Poddenige et al., 2025).
Estrutura probabilística: distribuições sobre os próprios componentes, como a probabilidade de cada operação em cada aresta (Muravev et al., 2021). O gerador da demonstração de amortização é desse tipo.
Diferente de um espaço de busca, que só lista o que é permitido, um espaço de representação modela como as arquiteturas se relacionam. Se essas representações ajudam mesmo sem supervisão é uma questão à parte (Yan et al., 2020).
Mecanismo
Quase todas as famílias de modelos generativos já foram aplicadas a arquiteturas. As quatro minidemonstrações abaixo ilustram as ideias principais no espaço de brinquedo. Cada uma é uma ilustração do princípio, não uma reimplementação dos métodos citados.
Otimização latente: codificar, subir, decodificar
Métodos como o NAO (Luo et al., 2019) embutem as arquiteturas num espaço contínuo, treinam nele um preditor de acurácia, sobem pelo gradiente do preditor e decodificam o resultado. Aqui, o eixo horizontal do mapa 2-D foi ajustado para prever acurácia e o vertical para prever tamanho, a partir de 120 células avaliadas. Cada pixel tem a cor da acurácia real da célula para a qual decodifica.
Clique para escolher um ponto de partida. Eixo horizontal: acurácia prevista. Eixo vertical: tamanho (células maiores para cima). Claro = acurácia real baixa, escuro = alta. Pixels cinza decodificam para uma célula degenerada. O anel marca a melhor célula real.
O que observar: muitos pixels decodificam para a mesma célula, e regiões inteiras decodificam para células degeneradas. É o descompasso entre um espaço contínuo e grafos discretos. A subida também para onde o preditor suave tem seu pico, que não é onde está a melhor célula real.
Difusão: tirar o ruído de uma célula aleatória até virar uma boa
Modelos de difusão aprendem a reverter um processo gradual de adição de ruído (Ho et al., 2020). Aplicados a grafos de arquitetura, um preditor pode guiar a remoção de ruído para acurácia alta (An et al., 2024). Aqui, os dados de treino são um arquivo de 300 células boas, o ruído troca a operação de uma aresta ao acaso e um preditor linear ajustado no arquivo fornece a orientação.
Clique em "Gerar uma" para ver uma célula se formar em 12 passos.
Barras cinza: acurácia das 300 células do arquivo. Depois de "Gerar 300", barras laranja: as células geradas. Os marcadores indicam a melhor célula do arquivo e a melhor célula real.
O que observar: o removedor exato é o melhor ajuste possível aos dados de treino, mas só consegue reproduzir células do arquivo (novidade 0) (Carlini et al., 2023). O removedor por aresta recombina arestas em células novas e, com orientação, pode chegar a células melhores que qualquer uma do arquivo. Uma orientação mais forte aumenta a acurácia e reduz a unicidade.
GFlowNets: amostrar em proporção à recompensa
Uma Generative Flow Network constrói um objeto passo a passo e é treinada para que objetos completos sejam amostrados com probabilidade proporcional à sua recompensa (Bengio et al., 2026), o que já foi aplicado à geração de arquiteturas (Soin et al., 2025). Aqui, a mesma política constrói uma célula uma aresta por vez, treinada com dois objetivos: aprendizado por reforço, que maximiza a recompensa esperada, e um objetivo de GFlowNet (trajectory balance) com recompensa \(R = \exp(\beta\,\text{acurácia})\).
Alvo: proporcional à recompensa
GFlowNet
Aprendizado por reforço
Clique em "Treinar as duas". O treino roda 200.000 episódios de construção por política.
Depois do treino
GFlowNet
Aprendizado por reforço
Acurácia esperada
–
–
Número efetivo de arquiteturas
–
–
Células distintas do top 1% em 1.000 amostras
–
–
O que observar: o aprendizado por reforço converge para uma única célula, uma estimativa pontual, como a busca. A GFlowNet mantém probabilidade em muitas células boas, aproximadamente em proporção à recompensa, então suas amostras continuam diversas.
Geração condicionada ao orçamento: um modelo, todos os orçamentos
A implantação acrescenta restrições como tamanho, latência ou energia. Em vez de uma busca por orçamento, geradores cientes de Pareto aprendem \(p_\theta(A \mid \lambda)\) para toda uma faixa de orçamentos \(\lambda\) (Guo et al., 2022)(Lomurno et al., 2024). Aqui, um gerador foi treinado em dez orçamentos. Mova o controle para pedir qualquer orçamento, inclusive os que ele nunca viu.
Cada célula válida (cinza), a fronteira de Pareto exata (linha), o orçamento (tracejado) e 50 amostras do gerador (azul se dentro do orçamento, laranja se acima).
O que observar: as amostras acompanham o orçamento enquanto ele se move, sem retreino e sem busca. Nem toda amostra cabe, porque este gerador pequeno escolhe cada aresta de forma independente, mas o tamanho de uma célula é de graça de calcular, então as amostras acima do orçamento são simplesmente descartadas antes de qualquer treino.
O que puxa um gerador para boas arquiteturas? Os estudos se dividem em dois grupos:
Guiados por preditor: um modelo substituto estima a acurácia e fornece gradientes ou notas que guiam a geração, como nas demonstrações latente e de difusão acima. O DiffusionNAG é um exemplo (An et al., 2024).
Sem preditor: a orientação vem de condicionamento embutido no treino, de priors estruturais ou de avaliações reais convertidas em recompensas, como na demonstração da GFlowNet. Exemplos incluem a orientação sem classificador em difusão de grafos (Asthana et al., 2024) e a geração baseada em GFlowNets (Soin et al., 2025).
Em ambos os casos, o passo que define a mudança do NAS para a NAG é que o sinal de desempenho é internalizado nos parâmetros do gerador, em vez de agir como um filtro externo depois do fato.
Alguns sistemas que propõem e criticam arquiteturas com grandes modelos de linguagem (Rahman & Chakraborty, 2024)(Yang et al., 2025) escapam de espaços de busca fixos, mas ainda dependem de ciclos iterativos de avaliar e refinar, então se comportam mais como busca do que como um modelo generativo aprendido.
Avaliando um gerador
Julgar uma distribuição, não uma única vencedora
Resultados de NAS costumam ser resumidos pela melhor arquitetura encontrada e pelo seu custo. Um gerador produz uma distribuição, e um único número não descreve uma distribuição.
Métricas emprestadas da modelagem generativa
Validade, unicidade, novidade. As amostras são grafos bem formados? São diferentes entre si? São diferentes dos dados de treino (Zhang et al., 2019)(Poddenige et al., 2025)? A demonstração de difusão mostra as três e como um modelo pode ter validade perfeita e novidade zero.
Divergências. A KL direta penaliza um gerador que deixa de cobrir regiões boas. A KL reversa penaliza um que põe massa em regiões ruins. Elas se complementam, e ranquear modelos por uma só métrica pode enganar (Theis et al., 2016)(Betzalel et al., 2022).
Alinhamento com a recompensa e eficiência de consultas. O quanto as frequências de amostragem acompanham o desempenho real (Soin et al., 2025), e quantas avaliações caras o treino exigiu (Lukasik et al., 2022).
O paradoxo dos benchmarks
Benchmarks tabulares como o NAS-Bench-101 (Ying et al., 2019) e o NAS-Bench-201 (Dong & Yang, 2020) guardam a acurácia treinada de cada arquitetura de um espaço fixo, então qualquer método pode ser pontuado por consulta. Isso dá reprodutibilidade e comparação justa, mas só se o gerador ficar confinado a esse espaço fixo, o que elimina justamente aquilo em que a NAG deveria ser boa: gerar além dele.
As alternativas têm seus próprios problemas. Treinar cada modelo gerado faz os resultados dependerem das receitas de treino (Yang et al., 2020). Pontuar com um preditor substituto importa os vieses do preditor, e um preditor treinado em projetos conhecidos tende a subestimar os novos, a mesma falha encontrada em métricas baseadas em features para imagens (Stein et al., 2023).
Problemas em aberto
Para onde a área está indo
A NAG é jovem, e vários desafios ainda limitam sua confiabilidade e adoção.
Validade por construção
Espaços latentes contínuos e a remoção estocástica de ruído podem produzir grafos que não são redes válidas, então as amostras muitas vezes precisam de reparo ou rejeição. Embutir restrições como aciclicidade e conectividade no próprio processo de geração é uma direção em aberto. Tokens discretos aprendidos são uma primeira tentativa (Poddenige et al., 2025).
Além dos espaços de busca fechados
A maioria dos geradores ainda opera sobre os conjuntos fixos de operações dos espaços de benchmark, então os ganhos podem refletir uma interpolação melhor dentro de uma tabela, e não novos princípios de projeto. Faltam protocolos de avaliação feitos para modelos generativos, que meçam diversidade, transferência e controlabilidade.
Orientação confiável
As paisagens arquitetura–desempenho são grandes e acidentadas, e um único preditor substituto raramente generaliza sobre elas, então os geradores podem acabar otimizando os erros do preditor. Orientação progressiva a partir de conjuntos de preditores mais fracos é uma resposta (Zhang & Zhuang, 2025).
Qualquer orçamento, na hora
Idealmente, um único gerador levaria qualquer orçamento de hardware a uma arquitetura quase ótima e compartilharia estrutura entre orçamentos, como na demonstração de orçamento, em vez de tratar cada orçamento como um problema separado (Guo et al., 2022)(Lomurno et al., 2024).
Priors arquiteturais zero-shot
A maioria dos geradores precisa de milhares de arquiteturas avaliadas antes de ser útil. Priors extraídos de benchmarks existentes (Xie et al., 2025) e dinâmicas evolutivas com pouco treino (Zhou et al., 2025) reduzem esse começo a frio. O objetivo de longo prazo é uma distribuição de fundação sobre arquiteturas que funcione entre tarefas.
Explicar os projetos gerados
Arquiteturas geradas raramente vêm com uma justificativa. Ciclos de crítica no estilo de agentes, que justificam cada escolha de projeto (Yang et al., 2025), apontam para geradores cujas decisões podem ser inspecionadas, o que importa para a confiança e para aprender algo com o que eles produzem.
Sobre o estudo
O artigo por trás desta página
Esta página se baseia em From Search to Synthesis: A Systematic Mapping Study of Neural Architecture Generation, de Thiago C. S. Barbieri, Edesio Alcobaça e André C. P. L. F. de Carvalho (Instituto de Ciências Matemáticas e de Computação, Universidade de São Paulo). O manuscrito está atualmente em revisão, e um link será adicionado aqui quando for publicado.
A página se apoia na formulação e na bibliografia do estudo. As demonstrações e todos os seus números foram feitos para esta página.
Referências
Todos os trabalhos citados nesta página
Agiollo, A., Omicini, A. (2022). GNN2GNN: Graph neural networks to generate neural networks. Proceedings of the Thirty-Eighth Conference on Uncertainty in Artificial Intelligence 180, 32–42. linkCitado em: Os três pilares de um gerador
Bengio, Y., Lahlou, S., Deleu, T., Hu, E. J., Tiwari, M., Bengio, E. (2026). GFlowNet Foundations. arXiv preprint. linkCitado em: Os três pilares de um gerador
Bergstra, J., Yamins, D., Cox, D. (2013). Making a Science of Model Search: Hyperparameter Optimization in Hundreds of Dimensions for Vision Architectures. Proceedings of the 30th International Conference on Machine Learning 28, 115–123. linkCitado em: Por que automatizar o projeto de arquiteturas?
Betzalel, E., Penso, C., Navon, A., Fetaya, E. (2022). A Study on the Evaluation of Generative Models. arXiv preprint. linkCitado em: Avaliando um gerador
Cai, H., Gan, C., Wang, T., Zhang, Z., Han, S. (2020). Once-for-All: Train One Network and Specialize it for Efficient Deployment. arXiv preprint. linkCitado em: Amortização: pagar uma vez, amostrar muitas
Carlini, N., Hayes, J., Nasr, M., Jagielski, M., Sehwag, V., Tramèr, F., Balle, B., Ippolito, D., Wallace, E. (2023). Extracting Training Data from Diffusion Models. arXiv preprint. linkCitado em: Os três pilares de um gerador
Domhan, T., Springenberg, J. T., Hutter, F. (2015). Speeding up automatic hyperparameter optimization of deep neural networks by extrapolation of learning curves. Proceedings of the 24th International Conference on Artificial Intelligence , 3460–3468. linkCitado em: Busca: a visão do NAS
Dong, X., Yang, Y. (2020). NAS-Bench-201: Extending the Scope of Reproducible Neural Architecture Search. arXiv preprint. linkCitado em: Busca: a visão do NAS, Avaliando um gerador
Elsken, T., Metzen, J. H., Hutter, F. (2019). Neural architecture search: a survey. J. Mach. Learn. Res. 20(1), 1997–2017.
Citado em: Busca: a visão do NAS
Guo, Y., Chen, Y., Zheng, Y., Chen, Q., Zhao, P., Chen, J., Huang, J., Tan, M. (2022). Pareto-aware Neural Architecture Generation for Diverse Computational Budgets. arXiv preprint. linkCitado em: Os três pilares de um gerador, Problemas em aberto
Li, J., Liu, Y., Liu, J., Wang, W. (2020). Neural Architecture Optimization with Graph VAE. arXiv preprint. linkCitado em: Os três pilares de um gerador
Li, L., Jamieson, K., DeSalvo, G., Rostamizadeh, A., Talwalkar, A. (2018). Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization. arXiv preprint. linkCitado em: Busca: a visão do NAS
Li, L., Talwalkar, A. (2020). Random Search and Reproducibility for Neural Architecture Search. Proceedings of The 35th Uncertainty in Artificial Intelligence Conference 115, 367–377. linkCitado em: Busca: a visão do NAS
Lukasik, J., Jung, S., Keuper, M. (2022). Learning Where to Look – Generative NAS is Surprisingly Efficient. Computer Vision – ECCV 2022 , 257–273.
Citado em: Avaliando um gerador
Naeem, M. F., Oh, S. J., Uh, Y., Choi, Y., Yoo, J. (2020). Reliable fidelity and diversity metrics for generative models. Proceedings of the 37th International Conference on Machine Learning (ICML).
Citado em: Avaliando um gerador
Pham, H., Guan, M., Zoph, B., Le, Q., Dean, J. (2018). Efficient Neural Architecture Search via Parameters Sharing. Proceedings of the 35th International Conference on Machine Learning 80, 4095–4104. linkCitado em: Busca: a visão do NAS
Rahman, M. H., Chakraborty, P. (2024). LeMo-NADe: Multi-Parameter Neural Architecture Discovery with LLMs. arXiv preprint. linkCitado em: Os três pilares de um gerador
Real, E., Moore, S., Selle, A., Saxena, S., Suematsu, Y. L., Tan, J., Le, Q., Kurakin, A. (2017). Large-Scale Evolution of Image Classifiers. arXiv preprint. linkCitado em: Busca: a visão do NAS
Real, E., Aggarwal, A., Huang, Y., Le, Q. V. (2019). Regularized evolution for image classifier architecture search. Proceedings of the AAAI Conference on Artificial Intelligence. doi:10.1609/aaai.v33i01.33014780Citado em: Busca: a visão do NAS
Rezaei, S. S. C., Han, F. X., Niu, D., Salameh, M., Mills, K., Lian, S., Lu, W., Jui, S. (2021). Generative Adversarial Neural Architecture Search. arXiv preprint. doi:10.48550/arXiv.2105.09356Citado em: Os três pilares de um gerador
Sajjadi, M. S. M., Bachem, O., Lucic, M., Bousquet, O., Gelly, S. (2018). Assessing Generative Models via Precision and Recall. arXiv preprint. linkCitado em: Avaliando um gerador
Stein, G., Cresswell, J. C., Hosseinzadeh, R., Sui, Y., Ross, B. L., Villecroze, V., Liu, Z., Caterini, A. L., Taylor, J. E. T., Loaiza-Ganem, G. (2023). Exposing flaws of generative model evaluation metrics and their unfair treatment of diffusion models. arXiv preprint. linkCitado em: Avaliando um gerador
Theis, L., van den Oord, A., Bethge, M. (2016). A note on the evaluation of generative models. arXiv preprint. linkCitado em: Avaliando um gerador
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., Polosukhin, I. (2017). Attention is all you need. Proceedings of the 31st International Conference on Neural Information Processing Systems , 6000–6010.
Citado em: Por que automatizar o projeto de arquiteturas?
White, C., Neiswanger, W., Savani, Y. (2020). BANANAS: Bayesian Optimization with Neural Architectures for Neural Architecture Search. arXiv preprint. linkCitado em: Busca: a visão do NAS
White, C., Safari, M., Sukthanker, R., Ru, B., Elsken, T., Zela, A., Dey, D., Hutter, F. (2023). Neural Architecture Search: Insights from 1000 Papers. arXiv preprint. linkCitado em: Busca: a visão do NAS
Xiang, L. (2023). Efficient Automated Neural Architecture Design. PhD thesis, University of Warwick. linkCitado em: Os três pilares de um gerador
Xie, J., Ji, H., Sun, Y. (2025). Prior Knowledge Guided Neural Architecture Generation. Proceedings of the 42nd International Conference on Machine Learning 267, 68671–68686. linkCitado em: Problemas em aberto
Yan, S., Zheng, Y., Ao, W., Zeng, X., Zhang, M. (2020). Does Unsupervised Architecture Representation Learning Help Neural Architecture Search?. arXiv preprint. linkCitado em: Os três pilares de um gerador
Yang, A., Esperança, P. M., Carlucci, F. M. (2020). NAS evaluation is frustratingly hard. arXiv preprint. linkCitado em: Avaliando um gerador
Ying, C., Klein, A., Real, E., Christiansen, E., Murphy, K., Hutter, F. (2019). NAS-Bench-101: Towards Reproducible Neural Architecture Search. arXiv preprint. linkCitado em: Avaliando um gerador
Yu, K., Sciuto, C., Jaggi, M., Musat, C., Salzmann, M. (2019). Evaluating the Search Phase of Neural Architecture Search. arXiv preprint. linkCitado em: Busca: a visão do NAS
Zhang, M., Jiang, S., Cui, Z., Garnett, R., Chen, Y. (2019). D-VAE: a variational autoencoder for directed acyclic graphs. Proceedings of the 33rd International Conference on Neural Information Processing Systems , 1588–1600.
Citado em: Os três pilares de um gerador, Avaliando um gerador
Zoph, B., Le, Q. V. (2017). Neural Architecture Search with Reinforcement Learning. arXiv preprint. linkCitado em: Busca: a visão do NAS
Zoph, B., Vasudevan, V., Shlens, J., Le, Q. V. (2018). Learning Transferable Architectures for Scalable Image Recognition. arXiv preprint. linkCitado em: Busca: a visão do NAS