doc-scraper: Go crawler que constrói contexto de documentação local para LLMs
doc-scraper, por Sriram PR, coleta documentação técnica de sites e a prepara para fluxos de trabalho assistidos por IA. O aplicativo rastreia sites de documentação e extrai conteúdo legível otimizado para uso como contexto de modelo, visando desenvolvedores e pesquisadores de IA. Ele enfatiza uma saída limpa e pesquisável e um repositório de conhecimento local para que assistentes baseados em editores possam acessar material de referência relevante sem puxar páginas da web barulhentas durante a construção de prompts.
Converte HTML de site em Markdown estruturado adequado para contexto de modelo
A ferramenta é um crawler baseado em Go que converte HTML de documentação em Markdown estruturado, removendo barras de navegação, rodapés e outros elementos não relacionados ao conteúdo. A conversão preserva cabeçalhos e código inline, enquanto reduz o ruído textual, produzindo arquivos de corpus compactos que mantêm o contexto de navegação por meio de cabeçalhos e links limpos para facilitar a recuperação e referência por fluxos de trabalho de modelo a jusante.
Buscabilidade e detecção de mudanças tornam o corpus confiável para agentes
O aplicativo incorpora uma busca offline BM25 implementada via SQLite FTS5, permitindo consultas locais contra o corpus rastreado sem acesso à internet. A persistência de estado com BadgerDB e SQLite suporta operações retomáveis e um índice de histórico. Um mecanismo de diff ciente em conteúdo identifica mudanças reais na página em vez de depender apenas de timestamps, o que reduz downloads redundantes e mantém o corpus local focado em edições substanciais.
Padrões de entrada e limites de rastreamento definem onde ele tem sucesso
doc-scraper detecta automaticamente frameworks de documentação como Docusaurus, MkDocs, Sphinx, GitBook e ReadTheDocs, e utiliza um extrator baseado em legibilidade em sites desconhecidos. O rastreamento ocorre em paralelo com gerenciamento de recursos compartilhados e limitação de taxa embutida, e o crawler respeita robots.txt para permanecer educado. Esses limites priorizam a extração de conteúdo relevante para desenvolvedores, evitando carga excessiva na rede.
Hospedagem local de MCP se adapta a fluxos de trabalho de IA centrados em editores e necessidades de privacidade
Quando executado em modo servidor, o aplicativo atua como um servidor de Protocolo de Contexto de Modelo para que agentes de IA locais possam ler e pesquisar documentação dentro de editores. O design da base de conhecimento local e offline mantém a documentação pesquisável disponível para agentes como Claude Desktop, Claude Code e Cursor, reduzindo a dependência de recuperação remota. A ferramenta é reconhecida nas comunidades de desenvolvedores de Go e IA por produzir saídas limpas em sites com os quais outros scrapers têm dificuldades.
Mais adequado para desenvolvedores tecnicamente proficientes que podem construir e hospedar contexto local
doc-scraper é uma opção prática para desenvolvedores e pesquisadores que precisam de documentação verificável, hospedada localmente, como contexto de modelo. Como a ferramenta requer construção a partir do código-fonte com Go (versão 1.25 ou posterior), ela favorece usuários tecnicamente capazes; equipes que não conseguem compilar projetos Go devem esperar sobrecarga de configuração. Os usuários devem inspecionar trechos raspados antes de usá-los como entradas autoritativas do modelo.





