Please use this identifier to cite or link to this item:
http://riu.ufam.edu.br/handle/prefix/10005| metadata.dc.type: | Trabalho de Conclusão de Curso |
| Title: | Enriquecimento de documentos jurídicos por meio de citações de usuários para recuperação de jurisprudência |
| metadata.dc.creator: | Nascimento, Nilton da Silva |
| metadata.dc.contributor.advisor1: | Moura, Edleno Silva de |
| metadata.dc.contributor.referee1: | Cavalcanti, João Marcos Bastos |
| metadata.dc.description.resumo: | A eficácia dos sistemas de busca no domínio jurídico impacta diretamente a celeridade processual e a qualidade das decisões judiciais, mas é dificultada pelo problema do vocabulário e pela natureza longa e multi-tópica dos documentos. Este trabalho avalia o uso de consultas e citações de usuários obtidas por feedback implícito de cópia como fonte de informação para descrever melhor o conteúdo de documentos jurídicos (precedentes, legislação e doutrina). Em parceria com a empresa Jusbrasil, utilizou-se o algoritmo BM25 para recuperar as consultas de usuários (copy queries) associadas a cada documento, agregando-as em um novo campo indexável, denominado Matches. Compararam-se estratégias de construção desse campo inserção bruta, filtragem por classificador supervisionado (Random Forest), validação por LLM, sumarização por LLM (Llama 3.1, nas versões 8B e 70B) e validação humana sob diferentes configurações de campos de indexação, medindo NDCG@1, @5 e @10 em dois regimes de julgamento de relevância: notas atribuídas pelo modelo Sabiá-4 (LLM-as-a-Judge) e regime misto, que prioriza as notas humanas quando disponíveis. A base de avaliação, com 465 consultas, foi expandida de 8.186 para 24.777 pares julgados, com concordância humano LLM moderada (Cohen’s κ quadrático de 0,52). As métricas comparativas são reportadas sobre o conjunto de teste, composto pelas 465 consultas da base de avaliação. A adição do campo Matches ao corpo do documento melhorou o NDCG@10 em todas as estratégias, com ganho de até +0,058 (≈ +7%) no regime LLM; o ganho é estatisticamente significativo quando as tags são sumarizadas ou validadas (teste-t pareado e Wilcoxon, p < 0,001 para a sumarização por 70B), sendo a sumarização a estratégia mais robusta entre os regimes de avaliação. |
| Abstract: | The effectiveness of search systems in the legal domain directly impacts procedural speed and the quality of judicial decisions, but is hindered by the vocabulary problem and by the long, multi-topic nature of legal documents. This work evaluates the use of user queries and citations obtained through implicit copy feedback — as a source of information to better describe the content of legal documents (precedents, legislation, and legal doctrine). In partnership with Jusbrasil, the BM25 algorithm was used to retrieve the user queries (copy queries) associated with each document, aggregating them into a new indexable field named Matches. Strategies for building this field were compared raw insertion, filtering by a supervised classifier (Random Forest), LLM validation, LLM summarization (Llama 3.1, 8B and 70B versions), and human validation under different index field configurations, measuring NDCG@1, @5, and @10 in two relevance judgment regimes: grades assigned by the Sabiá-4 model (LLM-as-a-Judge) and a mixed regime that prioritizes human grades when available. The evaluation collection, with 465 queries, was expanded from 8,186 to 24,777 judged pairs, with mod- erate human–LLM agreement (quadratic Cohen’s κ of 0.52). Comparative metrics are reported on the test set, comprising the 465 queries of the evaluation collection. Adding the Matches field to the document body improved NDCG@10 across all strategies, with gains of up to +0.058 (≈ +7%) in the LLM regime; the gain is statistically significant when tags are summarized or validated (paired t-test and Wilcoxon, p < 0.001 for 70B summarization), with summarization being the most robust strategy across evaluation regimes. |
| Keywords: | Recuperação de informação Domínio jurídico Feedback implícito Expansão de documentos BM25 Modelos de linguagem |
| metadata.dc.subject.cnpq: | CIENCIAS EXATAS E DA TERRA: CIENCIA DA COMPUTACAO |
| metadata.dc.language: | por |
| metadata.dc.publisher.country: | Brasil |
| metadata.dc.publisher.department: | ICOMP - Instituto de Computação |
| metadata.dc.publisher.course: | Engenharia de Software - Bacharelado - Manaus |
| metadata.dc.rights: | Acesso Aberto |
| metadata.dc.rights.uri: | https://creativecommons.org/licenses/by-nc-nd/4.0/ |
| URI: | http://riu.ufam.edu.br/handle/prefix/10005 |
| Appears in Collections: | Trabalho de Conclusão de Curso - Graduação - Ciências Exatas e da Terra |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| TCC_NiltonNascimento.pdf | 921,01 kB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.