Coleta de IA derrubando OJS

Olá!

Nossa equipe de TI identificou que diversos robôs realizam milhares de solicitações em intervalos curtos que ocasionam lentidão ou interrupção dos serviços do OJS e do DSpace. Mesmo filtrando vários e deixando apenas os da Google estes continuam a derrubar recorrentemente as aplicações.
Outras instituições também tem passado por isso? O que têm feito para solucionar?

Olá, @Kleber_UFBA.

Temos observado esse mesmo comportamento em diversos serviços públicos expostos à Internet. O aumento de crawlers, indexadores, scrapers e robôs de IA tem gerado volumes consideráveis de requisições, especialmente em plataformas acadêmicas como OJS e DSpace.

No entanto, antes de simplesmente bloquear os robôs, vale uma análise mais ampla da infraestrutura e da superfície de exposição da aplicação.

Além dos mecanismos tradicionais de mitigação (WAF, rate limiting, cache reverso e análise de logs), recomendamos verificar:

  • Existência de APIs públicas ou endpoints que permitam consultas massivas;
  • Endpoints de busca avançada excessivamente custosos;
  • Exportações OAI-PMH, REST APIs ou integrações que possam estar sendo utilizadas de forma intensiva;
  • Ausência de cache para páginas frequentemente acessadas;
  • Consultas lentas ao banco de dados;
  • Recursos de indexação e pesquisa que possam estar consumindo muitos recursos da aplicação.

Também é importante avaliar a implantação de um WAF (Web Application Firewall) ou solução equivalente. Além de auxiliar na proteção contra ataques, essas ferramentas permitem identificar padrões de comportamento automatizado, aplicar limitação de taxa (rate limiting), desafios de validação e outras medidas de proteção antes que as requisições atinjam o seu OJS.

Outro ponto relevante é que, se robôs legítimos de indexação (como Googlebot ou Bingbot) conseguem causar indisponibilidade, isso pode indicar não apenas excesso de tráfego, mas também oportunidades de melhoria na arquitetura da aplicação, banco de dados, cache ou infraestrutura subjacente.

Seria interessante saber quais User-Agents e quais URLs aparecem com maior frequência nos logs. Muitas vezes o problema não está na página principal, mas em endpoints específicos que acabam sendo explorados intensivamente pelos mecanismos automatizados.

4 curtidas