SearXNG, mecanismo de metabusca gratuito na internet
(github.com/searxng)- SearXNG é um mecanismo de metabusca que reúne várias fontes de pesquisa e não rastreia nem cria perfis dos usuários
- A instalação deve ser feita pelo Installation guide oficial, e os ajustes detalhados podem ser consultados no Configuration guide
- Métodos adicionais de operação e administração podem ser encontrados na área admin da documentação do SearXNG
- O canal da comunidade é a sala Matrix
#searxng:matrix.org - O projeto é licenciado sob a GNU Affero General Public License, AGPL-3.0
Papel do SearXNG
- SearXNG é um metasearch engine
- Os usuários não são rastreados nem perfilados no SearXNG
Instalação e configuração
- As instruções de instalação estão no Installation guide
- Configurações detalhadas e ajustes podem ser consultados no Configuration guide
- Métodos adicionais de operação estão organizados na documentação admin
Comunidade e contribuição
- Perguntas e contato com a comunidade podem ser feitos pelo canal Matrix
#searxng:matrix.org - Os detalhes sobre contribuição estão em CONTRIBUTING
Licença
- Este projeto é distribuído sob a GNU Affero General Public License
- Os detalhes da licença podem ser consultados em LICENSE
2 comentários
Opiniões no Hacker News
Se você quiser pesquisar no corpo de todas as páginas do histórico do navegador, ou apenas em algumas páginas marcadas como favoritas, vale ver o DownloadNet. O nome antigo, e talvez o nome que volte a ser usado, é "DiskerNet"
Ele se acopla ao navegador para oferecer uma experiência de navegação ampliada, e a UI é simples, com cara do Google de 1997 sem CSS. A busca ainda não faz nada muito complexo, mas poderá fazer no futuro, e já é bem útil hoje
https://github.com/dosyago/DownloadNet
Além disso, permite ver offline todo o conteúdo visitado ou marcado como favorito. Em ambientes onde é preciso economizar banda via satélite, como plataformas de petróleo, navios e transporte de carga de longa distância, é bom para ir salvando enquanto se navega normalmente
Eu preferiria que nada relacionado à minha navegação na internet fosse guardado, exceto no meu cérebro humano. Claro, esse é o meu critério
Mas não entendo por que uma propaganda tão explícita se encaixa aqui, para além de simplesmente fugir do assunto, como uma ferramenta que é o exato oposto de privacidade pessoal total
Dá saudade dos velhos tempos. Antes do Google, eu usava ferramentas de metabusca para aumentar as chances de encontrar uma resposta decente no meio dos resultados de busca cheios de spam de lugares como AltaVista, HotBot e Lycos
Também dava para incluir resultados de busca em FTP, o que era útil numa época em que FTP anônimo público ainda era comum
Este aqui também vale testar. Não é Kagi, mas os resultados de busca são bem bons e dá para hospedar você mesmo com Docker
https://felladrin-minisearch.hf.space/
Bom. Seria ótimo se houvesse uma forma de bloquear certos domínios para que nunca apareçam nos resultados de busca
Edit: parece que já existe uma issue aberta
https://github.com/searxng/searxng/issues/2351
A intenção do SearXNG é funcionar sem armazenar estado, sem sessão no servidor, e também sem JavaScript
Mas essa abordagem limita alguns recursos por causa do limite de tamanho dos cookies. Outras formas de armazenamento no navegador exigem JavaScript
Ainda dá para fazer isso hoje inserindo manualmente os critérios de exclusão a cada busca, mas a lista pode ficar longa e é difícil dizer que a experiência de uso seja boa
O Kagi tem esse recurso embutido e é fácil de usar
Também dá para usar a extensão de navegador uBlacklist. No meu caso, porém, o problema foi que tudo ficou mais lento
Não tenho certeza, mas parece que ela filtra os resultados reais depois que a busca termina. As duas abordagens acima limitam os resultados para que nem entrem na lista desde o início
Uso no Firefox para filtrar o lixo do Pinterest dos resultados de busca, e também há versões para Chrome e Safari
https://github.com/iorate/ublacklist
Se você rodar isso em uma conexão residencial, corre o risco de não conseguir mais usar os mecanismos de busca
Para uso pessoal, você pode executar direto no seu computador ou acessar via VPN. As consultas enviadas aos mecanismos de busca upstream podem passar por proxy ou VPN conforme necessário
Alguns funcionam bem também via Tor, e outros podem passar por túneis comerciais ou feitos por você mesmo
Se você rodar localmente e só você usar, não será bloqueado. Do ponto de vista do mecanismo de busca, o número de requisições parecerá quase o mesmo de quando você o usa diretamente
Mesmo que mais algumas pessoas em casa usem, ainda deve ficar tudo bem
Rodei o searx antigo localmente por cerca de 1 a 2 anos e não tive nenhum problema
Há muitas instâncias públicas hospedadas do searx. Também existe uma lista online de instâncias públicas e, se você quiser uma ferramenta que envie cada busca feita pela barra de endereço do navegador para uma instância aleatória, pode usar o neocities: https://searx.neocities.org/changelog
Uso sempre. A desvantagem é que às vezes você cai em uma instância que não retorna resultado nenhum ou retorna resultados muito ruins. Ultimamente isso tem acontecido com menos frequência
O SearXNG é excelente, mas há alguns pontos de atenção
Rodá-lo junto em uma máquina que fornece NAT para vários dispositivos ajuda a evitar bloqueios pelos mecanismos de busca upstream, como o DuckDuckGo. Se você não puder rodá-lo em um IP também usado para outras finalidades, seria bom ter um recurso para enviar o acesso a certos mecanismos upstream por um proxy separado. Esse problema é muito comum
Seria bom ter um modo de busca 100% literal, em que todas as palavras que eu digitei apareçam obrigatoriamente nos resultados exatamente como estão. Talvez seja equivalente a colocar "+" antes de cada palavra e aspas em cada uma delas. É irritante ver a busca mudando palavras que eu explicitamente não queria que fossem mudadas só porque há poucos resultados
Como já foi dito em outros lugares, quero excluir explicitamente certos domínios. Entendo que o SearXNG queira ser sem estado, mas isso poderia ser configurado por uma URL separada ou como uma configuração aplicada a todas as buscas. Por exemplo, quando procuro algum manual em PDF, nunca quero ver sites como "manualslib.com"
Seria ótimo se essas coisas fossem resolvidas, mas, fora isso, rodar o SearXNG e recomendar às pessoas que o usem no lugar do Google funcionou muito bem
Todo mundo vende o Searx, mas pessoalmente gosto do presearch.com
Não tenho nenhuma afiliação nem interesse financeiro. Também não me interesso pelo modelo de negócios deles baseado em criptomoeda
Na verdade, acho que a falta de filtragem de resultados ao estilo Google ou Bing não vem de uma postura de defesa da liberdade de expressão, mas sim de falta de recursos ou de outras prioridades mais importantes para o sucesso. É parecido com os primórdios da internet, quando a fase de necessidades das empresas estava mais focada em fazer as coisas funcionarem do que em mostrar apenas sentimentos positivos de marketing ou falas corretas
De todo modo, quando procuro algo obscuro ou um tema que acho que o Google filtraria fortemente, consulto o presearch para obter uma segunda perspectiva. Seria bom se o archive.org fizesse algo parecido. O archive.org tem dados enormes, mas a indexação e a capacidade de busca não são boas
É minha ferramenta favorita para pegar os resultados individualmente ruins dos mecanismos de busca mainstream e tirar uma média que vira resultados mais ou menos utilizáveis
No último ano, venho usando isso como padrão em todos os meus dispositivos e estou muito satisfeito. Só ficou bloqueado duas vezes, e bastou atualizar para voltar a funcionar bem
Comentários no Hacker News
Sou o criador original do Searx, mas não participo mais do desenvolvimento por causa das limitações do conceito de metabusca. Meu novo projeto de busca é https://github.com/asciimoo/hister (https://hister.org/)
O Hister é um indexador especializado para sites e arquivos locais, e salva automaticamente as páginas visitadas renderizadas pelo navegador
Como armazena o conteúdo completo das páginas, ele permite pré-visualização offline dos resultados e o fornecimento da página inteira via MCP
Um exemplo de uso com MCP pode ser visto aqui: https://hister.org/posts/give-your-ai-assistant-a-private-me...
Concluí que a configuração ideal para mim seria um repositório de conteúdo auto-hospedado que extraísse e armazenasse o conteúdo e os metadados das páginas web com um mecanismo de busca e uma extensão de navegador, e, se possível, também queria compartilhamento federado de conteúdo e importação de conteúdo Creative Commons como Wikipedia e Gutenberg
O Hister parece chegar muito perto exatamente do que eu queria, e quero fazer uma auditoria de código e uma implantação daqui a algumas semanas
Baixo apenas título, descrição, miniatura e os campos comuns de Open Graph, então considero o índice bem leve. Já rastreei 2 milhões de páginas
https://github.com/rumca-js/Internet-Places-Database
Suporta tags e votação
Recentemente também lancei meu primeiro app no F-Droid
https://github.com/rumca-js/OfflineWebSearch
https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
Há anos venho reunindo links variados relacionados ao trabalho e uso isso todos os dias para responder perguntas aleatórias de amigos ou colegas, quase como tirar um coelho da cartola. Por exemplo, se me perguntam sobre ideias de paleta de cores para gráficos de dados, consigo passar imediatamente pesquisas científicas relacionadas; o mesmo vale para algoritmos pouco conhecidos
Com o tempo, a coleção ficou bem grande e ficou muito incômodo encontrar a coisa certa, então fico pensando se este projeto se encaixaria bem no meu problema
Isso parece ser a ferramenta central para fornecer busca a modelos locais
Fico curioso sobre que tipo de configuração as outras pessoas usam para oferecer essa funcionalidade
Desde que saiu o modelo Gemma quantizado de 24 bilhões de parâmetros, as chamadas de ferramentas funcionaram bem na 4070 Ti Super, e graças às chamadas de ferramentas bem-sucedidas meu ambiente local finalmente ficou utilizável
Só para constar, estou falando de contexto geral, não especificamente de programação
curlejqEstá no fim desta página: https://docs.searxng.org/admin/settings/settings_search.html
llama-server, por exemploO Open WebUI tem integração com SearX e outros provedores, mas os resultados que obtive não foram muito impressionantes
Uso o SearXNG como busca padrão na internet há mais de 5 anos e também mantenho alternativas como o backend do YaCy. Com essa configuração, também crio busca em documentação interna e aplicações de RAG, e o SearXNG também suporta resultados em JSON
Ainda assim, há desvantagens que aceito por causa da privacidade. É mais lento e a qualidade dos resultados fica abaixo de outros buscadores, mas para a maioria das consultas é rápido o bastante e bom o bastante
De vez em quando sou bloqueado por buscas como DuckDuckGo e Brave e preciso resolver um CAPTCHA, mas isso pode ser evitado usando uma chave de API
Se você usar seu próprio backend, pode dar prioridade nos resultados; por exemplo, se rastrear a small web ou sites importantes para você, esses sites aparecem no topo dos resultados de busca
Fico curioso se você roda a instância do YaCy diretamente de forma “muito rápida” ou se usa alguma configuração específica
Na minha experiência, o YaCy fazia streaming lento dos resultados ao longo de uns 30 segundos, então não combinava bem como backend do SearX
Também sirvo localmente arquivos ZIM da Wikipedia, Wiktionary, Gutenberg, ArchWiki etc. com
kiwix-serve, mas o mecanismo de busca do Kiwix [0] também retorna resultados demais e polui a página de resultados do SearX, então também não combina bem como backendAinda não tentei conectar o SearX a uma instância local do Recoll [1]. O Recoll não suporta indexação de arquivos ZIM, mas pode ser útil para outros documentos HTML arquivados
É difícil fazer busca direito, então se existe uma configuração que realmente funcione bem, eu gostaria de saber mais
[0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
[1] https://docs.searxng.org/dev/engines/online/recoll.html
Uso o SearXNG há alguns anos. Por causa da censura de rede desumana da GFW e da detecção de proxy dos mecanismos de busca, não opero minha própria instância e dependo da lista de instâncias públicas [1] e do libredirect [2]
O serviço de uma única instância não é garantido, mas dá para trocar para outra instância disponível em menos de 1 minuto, quase sem custo
É difícil dizer que o SearXNG ajuda a se livrar do Google. Um metabuscador chama outros mecanismos de busca, como o Google, para coletar resultados
Mesmo assim, ao usar o SearXNG, dá para escapar rapidamente de coisas como resumos por IA
[1] https://searx.space
[2] https://github.com/libredirect/browser_extension
Muitas vezes é preciso entrar nas configurações e desativar mecanismos de busca que não funcionam, ou selecionar os que funcionam bem. Normalmente isso acontece porque a instância foi bloqueada, então há problemas de confiabilidade
Quais mecanismos funcionam varia entre instâncias públicas, então até salvar o hash de configuração nem sempre resolve
Seria bom se o SearXNG ajustasse automaticamente os mecanismos exibidos com base na confiabilidade, ou oferecesse uma opção para isso
Faz alguns anos que uso em self-hosting como mecanismo padrão para todas as buscas, e recomendo fortemente
O TinySearch funciona bem para agentes envolvendo o SearXNG. É melhor que o MCP nativo do SearXNG, porque otimiza o contexto antes de chegar ao agente e evita desperdício de tokens
https://github.com/MarcellM01/TinySearch
Funciona bem quando conectado à API do Brave Search, mas como scraper é bem instável. O Google parou de funcionar há alguns dias
Criei https://github.com/denysvitali/searxng-mcp para usar como MCP para agentes de programação. Funciona muito bem até atingir o limite de requisições de provedores como o DuckDuckGo
Como também era necessário um servidor SearXNG para rodar, recentemente mudei de direção para a solução standalone https://github.com/denysvitali/search-mcp
[1]: https://github.com/nikvdp/searxng-ai-kit
Já gosto muito do SearXNG há bastante tempo. Minha antipatia pelo Google só aumenta, e é ótimo poder pesquisar evitando coisas como um pequeno modelo de IA ser instalado no meu PC sem o meu consentimento
Sempre gostei dessa ferramenta, mas tenho sentimentos mistos sobre o quanto isso ajuda na privacidade quando sua busca é enviada não para uma empresa, mas para 280 empresas