Please use this identifier to cite or link to this item: http://riu.ufam.edu.br/handle/prefix/9886
metadata.dc.type: Trabalho de Conclusão de Curso
Title: Avaliação experimental do uso de Aprendizado por Reforço para Alocação Dinâmica de Canais em Cenários LEO Multifeixe Simplificados
metadata.dc.creator: Naja, Luca Dias
metadata.dc.contributor.advisor1: Carvalho, Celso Barbosa
metadata.dc.contributor.referee1: Silva Júnior, Waldir Sabino da
metadata.dc.contributor.referee2: Santos, Kenny Vinente dos
metadata.dc.description.resumo: As redes de satélites em órbita baixa da Terra (Low Earth Orbit – LEO) surgem como uma alternativa relevante para ampliar a conectividade em regiões remotas, áreas de difícil acesso e cenários com infraestrutura terrestre limitada. Entretanto, essas redes apresentam desafios relacionados à mobilidade dos satélites, à limitação de recursos de rádio e à distribuição desigual da demanda. Nesse contexto, este trabalho avalia experimentalmente o uso de aprendizado por reforço para alocação dinâmica de canais em cenários LEO multifeixe simplificados, comparando heurísticas clássicas com uma abordagem baseada em Proximal Policy Optimization (PPO). Como contribuição, foi desenvolvido um ambiente experimental integrado, combinando um simulador de decisão em Python com uma simulação complementar em ns-3, permitindo analisar os efeitos das políticas de alocação tanto no processo de decisão quanto em métricas de rede, como vazão, bloqueio e atraso. Os resultados indicam que políticas adaptativas apresentam melhor desempenho que estratégias uniformes ou rotativas em cenários com demanda assimétrica. A heurística Greedy Backlog obteve o maior tráfego atendido e a menor taxa de bloqueio, enquanto o agente PPO apresentou o menor atraso médio no cenário principal e desempenho próximo ao das heurísticas intermediárias. Testes com diferentes condições de carga, concentração de demanda no hotspot e disponibilidade de canais mostraram que o PPO manteve comportamento consistente nas métricas de vazão, bloqueio e atraso. Assim, os resultados indicam que o aprendizado por reforço possui potencial para adaptação a mudanças de demanda e distribuição de recursos em cenários LEO multifeixe simplificados.
Abstract: Low Earth Orbit (LEO) satellite networks emerge as a relevant alternative to expand connectivity in remote regions, hard-to-reach areas, and scenarios with limited terrestrial infrastructure. However, these networks face challenges related to satellite mobility, limited radio resources, and uneven demand distribution. In this context, this work experimentally evaluates the use of reinforcement learning for dynamic channel allocation in simplified multibeam LEO scenarios, comparing classical heuristics with an approach based on Proximal Policy Optimization (PPO). As a contribution, an integrated experimental environment was developed, combining a Python decision simulator with a complementary ns-3 simulation, enabling the analysis of allocation policies both in the decision-making process and in network-level metrics, such as throughput, blocking, and delay. The results indicate that adaptive policies outperform uniform or rotational strategies in scenarios with asymmetric demand. The Greedy Backlog heuristic achieved the highest served traffic and the lowest blocking rate, while the PPO agent achieved the lowest average delay in the main scenario and performance close to intermediate heuristics. Tests under different traffic load conditions, hotspot demand concentration, and channel availability showed that PPO maintained consistent behavior in throughput, blocking, and delay metrics. Therefore, the results indicate that reinforcement learning has potential for adapting to demand changes and resource distribution in simplified multibeam LEO scenarios.
Keywords: Redes de satélites LEO
Redes não terrestres
Alocação dinâmica de canais
Aprendizado por reforço
Simulação de redes
metadata.dc.subject.cnpq: CIENCIAS EXATAS E DA TERRA
metadata.dc.language: por
metadata.dc.publisher.country: Brasil
metadata.dc.publisher.department: FT - Faculdade de Tecnologia
metadata.dc.publisher.course: Engenharia da Computação - Bacharelado - Manaus
Citation: NAJA, Luca Dias. Avaliação experimental do uso de aprendizado por reforço para alocação dinâmica de canais em cenários LEO multifeixe simplificados. 2026. 71 f. Trabalho de Conclusão de Curso (Bacharelado em Engenharia da Computação) - Universidade Federal do Amazonas, Manaus, 2026.
metadata.dc.rights: Acesso Aberto
metadata.dc.rights.uri: https://creativecommons.org/licenses/by-nc-nd/4.0/
URI: http://riu.ufam.edu.br/handle/prefix/9886
Appears in Collections:Trabalho de Conclusão de Curso - Graduação - Engenharias

Files in This Item:
File Description SizeFormat 
TCC_LucaNaja.pdf2,31 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.