Please use this identifier to cite or link to this item:
http://riu.ufam.edu.br/handle/prefix/10027| metadata.dc.type: | Trabalho de Conclusão de Curso |
| Title: | EdgeBench: uma plataforma aberta de benchmarking para modelos de linguagem em hardware de borda |
| metadata.dc.creator: | Uchoa, Matheus Serrão |
| metadata.dc.contributor.advisor1: | Carvalho, Celso Barbosa |
| metadata.dc.contributor.referee1: | Silva Júnior, Waldir Sabino da |
| metadata.dc.contributor.referee2: | Mattos, Edma Valléria Cunha Urtiga de |
| metadata.dc.description.resumo: | Atualmente, a proliferação de Modelos de Linguagem de Grande Escala (Large Language Models, LLMs) em dispositivos de borda impõe desafios inéditos de avaliação, uma vez que métricas de desempenho isoladas são insuficientes para caracterizar o comportamento de modelos quantizados em hardware heterogêneo. Diante dessa lacuna, este trabalho apresenta o EdgeBench, uma plataforma open-source de benchmarking que integra, de forma unificada, medição de desempenho, telemetria de hardware e avaliação de qualidade para LLMs executados em dois caminhos complementares: o Path A (agente local com Ollama/llama.cpp) e o Path B (inferência no navegador via WebGPU). Nesse sentido, a arquitetura é composta por cinco elementos: (i) um agente Python (edgebench-agent) que expõe uma API HTTP+SSE e instrumenta o hardware via RAPL, NVML e INA219, além de uma TUI (Terminal User Interface) em Go com setup wizard e atualização automática; (ii) uma camada de inferência no navegador via @mlc-ai/web-llm com WebGPU, sem instalação de software; (iii) uma camada de avaliação de qualidade que computa perplexidade, subconjunto MMLU, consistência e conformidade de formato localmente, além de avaliação assíncrona via LLM-as-Judge (Claude Sonnet); (iv) um backend em Fastify com fila BullMQ/Redis e persistência em PostgreSQL com TimescaleDB; e (v) uma interface web em Next.js 16 com autenticação OAuth, design system Mutum e leaderboard comunitário. Quanto à validação, experimentos em hardware real, a saber, navegador com WebGPU (70 tok/s em GPU NVIDIA), Jetson Nano (7,29 tok/s) e Raspberry Pi 4 (3,81 tok/s) executando TinyLlama-1.1B em CPU, demonstram a viabilidade do sistema e revelam diferenças de comportamento entre plataformas, pois o Jetson Nano supera o Raspberry Pi 4 apesar de possuir CPU de geração anterior, em razão do throttling térmico do Pi 4 sob carga, caracterização inacessível por especificações de fábrica. Adicionalmente, a suite de qualidade local (50 casos, 8 dimensões) e o pipeline LLM-as-Judge complementam a análise de desempenho com a avaliação da capacidade cognitiva do modelo. Por fim, o código-fonte, os dados experimentais e a documentação estão disponíveis publicamente no repositório do projeto. |
| Abstract: | Currently, the proliferation of Large Language Models (LLMs) on edge devices poses unprecedented evaluation challenges, since isolated performance metrics are insufficient to characterize the behavior of quantized models on heterogeneous hardware. Accordingly, this work presents EdgeBench, an open-source benchmarking platform that unifies performance measurement, hardware telemetry, and quality assessment for LLMs executed across two complementary execution paths: Path A (local agent with Ollama/llama.cpp) and Path B (in-browser inference via WebGPU). In this regard, the architecture comprises five elements: (i) a Python agent (edgebench-agent) exposing an HTTP+SSE API with hardware instrumentation via RAPL, NVML, and INA219, together with a Go TUI featuring a setup wizard and auto-update; (ii) a browser inference layer via @mlc-ai/web-llm with WebGPU, requiring zero software installation; (iii) a quality evaluation layer computing perplexity, an MMLU subset, consistency, and format compliance locally, together with asynchronous LLM-as-Judge evaluation (Claude Sonnet); (iv) a Fastify backend with a BullMQ/Redis queue and PostgreSQL+TimescaleDB persistence; and (v) a Next.js 16 web interface with OAuth authentication, the Mutum design system, and a community leaderboard. Regarding validation, experiments on real hardware, namely a browser with WebGPU (70 tok/s on an NVIDIA GPU), a Jetson Nano (7.29 tok/s), and a Raspberry Pi 4 (3.81 tok/s) running TinyLlama-1.1B on CPU, demonstrate system feasibility and reveal behavioral differences between platforms, as the Jetson Nano outperforms the Raspberry Pi 4 despite its older-generation CPU, owing to the Pi 4's thermal throttling under load, a characterization inaccessible from datasheets. Moreover, the local quality suite (50 cases, 8 dimensions) and the LLM-as-Judge pipeline complement performance analysis with an assessment of the model's cognitive capability. Finally, the source code, experimental data, and documentation are publicly available in the project repository. |
| Keywords: | Edge computing LLM Benchmarking WebGPU Quantização Avaliação de qualidade LLM-as-Judge |
| metadata.dc.subject.cnpq: | ENGENHARIAS: ENGENHARIA ELETRICA: TELECOMUNICACOES: SISTEMAS DE TELECOMUNICACOES |
| metadata.dc.language: | por |
| metadata.dc.publisher.country: | Brasil |
| metadata.dc.publisher.department: | FT - Faculdade de Tecnologia |
| metadata.dc.publisher.course: | Engenharia da Computação - Bacharelado - Manaus |
| Citation: | UCHOA, Matheus Serrão. EdgeBench: uma plataforma aberta de benchmarking para modelos de linguagem em hardware de borda. 2026. 103 f. Trabalho de Conclusão de Curso (Bacharelado em Engenharia da Computação) - Universidade Federal do Amazonas, Manaus, 2026. |
| metadata.dc.rights: | Acesso Aberto |
| metadata.dc.rights.uri: | https://creativecommons.org/licenses/by-nc-nd/4.0/ |
| URI: | http://riu.ufam.edu.br/handle/prefix/10027 |
| Appears in Collections: | Trabalho de Conclusão de Curso - Graduação - Engenharias |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| TCC_MatheusUchoa.pdf | 1,52 MB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.