• About
  • Advertise
  • Careers
  • Contact
Segunda-feira, 27 Julho 2026
  • Iniciar sessão
Sem resultados
Ver todos os resultados
Noticias Portugal
  • Home
  • Últimas notícias
  • Economia
  • Deporto
  • Sociedade
  • Internacional
  • Mais notícias
    • Tecnologia
    • Receitas
    • Viagens
  • Home
  • Últimas notícias
  • Economia
  • Deporto
  • Sociedade
  • Internacional
  • Mais notícias
    • Tecnologia
    • Receitas
    • Viagens
Sem resultados
Ver todos os resultados
Noticias Portugal
Sem resultados
Ver todos os resultados
início da web Tecnologia

Scrapling aposta por um scraping “auto-reparável” em Python: parser adaptativo, spiders e uma API unificada

por Notícias Tecnologia
01/03/2026
em Tecnologia
0
0
ACÇÕES
6
VISTAS
Share on FacebookShare on Twitter

O crescimento do Scrapling: uma nova abordagem para o web scraping em Python

O ecossistema Python tem visto evoluções significativas no campo do web scraping, uma prática que caminha entre soluções rápidas e a necessidade de manutenção contínua. Surge agora o Scrapling, um framework desenvolvido por Karim Shoair, do D4Vinci, que promete resolver um dos maiores desafios enfrentados por equipes técnicas e engenheiros de dados: a manutenção de scrapers em um cenário onde sites frequentemente mudam.

A proposta do Scrapling é clara: os redirecionamentos quebram seletores e as alterações no DOM desestabilizam rotas de dados, tornando a real manutenção do scraping um esforço constante. Para enfrentar esse problema, o projeto une três componentes em uma única biblioteca: um parser de alto desempenho, um mecanismo adaptativo para localizar elementos após mudanças no HTML e um sistema de spiders que permite escalabilidade no crawling, tudo isso sem a necessidade de alternar entre diferentes ferramentas.

Entre as características marcantes do Scrapling, seus benchmarks de parsing chamam a atenção. Testes realizados com 5.000 elementos aninhados mostraram que o Scrapling alcançou uma média de 2,02 ms, em contraste com os 1.584,31 ms do BeautifulSoup com lxml. Essa comparação destaca a eficiência do Scrapling, embora também evidencie que ferramentas como Parsel/Scrapy e o lxml “puro” se aproximam em termos de desempenho.

O diferencial do Scrapling vai além da velocidade; seu projeto incorpora um conceito de “rastreamento inteligente de elementos”, que permite preservar o contexto de um elemento e, quando um site altera sua estrutura, tenta realocá-lo com algoritmos de similaridade, ao invés de depender apenas de seletores fixos. Essa inovação visa reduzir o trabalho necessário para corrigir scrapers ativos a cada vez que um site muda.

Adicionalmente, o Scrapling se propõe a unificar o trabalho de transporte, integrando diferentes tipos de “fetchers” sob uma única API: um Fetcher padrão para requisições HTTP, um DynamicFetcher baseado em Playwright para sites dinâmicos e um StealthyFetcher para situações onde métodos tradicionais não são eficazes.

No que se refere aos spiders, o Scrapling adota uma abordagem semelhante ao Scrapy, oferecendo funcionalidade de múltiplas sessões, pausar e retomar crawls, além de permitir a configuração de concorrência e delays por domínio. Isso facilita a implementação de pipelines de dados, onde o controle do estado e reintentos são tão importantes quanto a lógica de parsing.

Finalmente, Scrapling proporciona uma experiência positiva para o desenvolvedor, com uma interface de linha de comando (CLI), um shell interativo similar ao IPython e integração com ferramentas de IA para otimizar fluxos de trabalho de extração de dados.

Com uma cobertura de testes de 92% e total compatibilidade com type hints, o Scrapling promete ser uma ferramenta robusta para aqueles que buscam uma solução eficaz e sustentável no campo do web scraping. Disponível no PyPI como scrapling 0.4 desde 15 de fevereiro de 2026, requer Python 3.10 ou versões superiores.

Tags: adaptativoAPIapostaautoreparávelparserporPythonscrapingScraplingspidersumaunificada
Notícias Tecnologia

Notícias Tecnologia

Related Posts

Nvidia e SK preparam aliança de mais de 500 bilhões para IA

por Notícias Tecnologia
26/07/2026
0

Nvidia e SK Group assinam acordo de parceria avaliado em mais de 500 bilhões de dólares Na última cúpula de...

A bateria substituível da UE terá exceções para smartwatches

por Notícias Tecnologia
25/07/2026
0

A partir de fevereiro de 2027, uma nova legislação da União Europeia exigirá que a maioria dos dispositivos eletrônicos, como...

NVIDIA ativa na universidade militar dos EUA seu supercomputador DGX GB300

por Notícias Tecnologia
23/07/2026
0

A Escola Naval de Pós-Graduação dos Estados Unidos deu início ao funcionamento de um sistema NVIDIA DGX GB300 voltado para...

Recommended

Eficiência, Sustentabilidade e Inteligência na Mobilidade: Jovens Estudantes Desafiados a Imaginar o Futuro

7 meses atrás

Crescimento de 76% no Setor Imobiliário Comercial no Primeiro Semestre do Ano

11 meses atrás

Popular News

  • Silvia Pastor

    Débito Invisível: O Risco Tecnológico e o Impagamento de Alugueis

    0 shares
    Share 0 Tweet 0
  • Na Síria, Guterres destaca apoio contínuo da ONU para a transição política e a reconstrução do país

    0 shares
    Share 0 Tweet 0
  • Avaliação de Habitação Registra Crescimento de 16,6% em Relação ao Ano Anterior

    0 shares
    Share 0 Tweet 0
  • WTO Blog | Por que o trânsito de mercadorias é livre, mas o comércio não é?

    0 shares
    Share 0 Tweet 0
  • Anúncio das Datas das Sessões do Plenário do COJ para 2026

    0 shares
    Share 0 Tweet 0

Connect with us

  • About
  • Advertise
  • Careers
  • Contact

© 2025 Noticias Portugal

Welcome Back!

Login to your account below

Forgotten Password?

Retrieve your password

Please enter your username or email address to reset your password.

Log In
Sem resultados
Ver todos os resultados
  • Home
  • Internacional
  • Economia
  • Viagens
  • Deporto
  • Sociedade
  • Tecnologia
  • Receitas

© 2025 Noticias Portugal