A avaliação do impacto científico depende, majoritariamente, de indicadores baseados em citações, que apenas se consolidam após longos períodos, limitando sua utilidade em decisões editoriais, avaliativas e de gestão da informação. Este estudo investiga em que medida o título de artigos científicos, isoladamente ou enriquecido com metadados bibliográficos simples disponíveis antes da publicação, pode antecipar o impacto futuro em termos de citações. O problema é formulado como classificação binária de artigos de alto e baixo impacto. Os experimentos utilizam 78.707 artigos da revista Physical Review A, da American Physical Society, com impacto definido por agrupamento por quartis de citações. Emprega-se um modelo baseado em representações linguísticas contextuais, avaliado por validação cruzada estratificada (5-fold), comparando o uso exclusivo do título e sua combinação com metadados simples, ano de publicação, número de autores e pontuação. Os resultados, avaliados pelo Coeficiente de Correlação de Matthews, métrica normalizada cujo valor máximo é 1 e valores próximos de 0 indicam desempenho aleatório, indicam desempenho limitado para títulos isolados (MCC ≈ 0,283) e ganho expressivo com metadados (MCC ≈ 0,509), estatisticamente significativo (Wilcoxon, p < 0,05). Os achados indicam o potencial de abordagens preditivas como apoio à avaliação científica, políticas editoriais e comunicação da ciência.
The assessment of scientific impact relies largely on citation-based indicators, which only consolidate over long periods, limiting their usefulness for early editorial decisions, research evaluation, and information management. This study investigates to what extent article titles, used alone or enriched with simple bibliographic metadata available prior to publication, can anticipate future citation impact. The problem is formulated as a binary classification task, distinguishing high-impact and low-impact articles. Experiments are conducted on 78,707 articles from Physical Review A, published by the American Physical Society, with impact defined using citation quartile grouping. A model based on contextual linguistic representations is employed and evaluated using stratified 5-fold cross-validation, comparing the exclusive use of titles with their combination with simple metadata, namely publication year, number of authors, and punctuation. Results are assessed using the Matthews Correlation Coefficient, a normalized metric whose maximum value is 1 and values close to 0 indicate random performance. The findings show limited performance for titles alone (MCC ≈ 0.283) and a substantial improvement when metadata are included (MCC ≈ 0.509), which is statistically significant (Wilcoxon, p < 0.05). These results highlight the potential of predictive approaches as support tools for research evaluation, editorial policies, and scholarly communication.