Por dois anos, a hipótese comum no mercado de SEO era simples: o ChatGPT só recupera resultados via Bing e Google, sem índice próprio. Uma investigação recente, baseada em eventos técnicos do próprio ChatGPT, vagas de emprego da OpenAI e testemunho sob juramento no processo antitruste do Google, mostra que essa hipótese está errada. Se a sua estratégia para o ChatGPT para no Bing, você está perdendo a maior parte do sistema.
Resumo
- O ChatGPT roda seu próprio índice de recuperação, chamado internamente de Labrador — não é um índice único, e sim uma família de índices verticais: web geral, PDF, YouTube, notícias, Arxiv, Wikipedia, local, finanças, jurídico, saúde, shopping e imagens.
- Testemunho no processo antitruste do Google e vagas de emprego da OpenAI confirmam que o índice do ChatGPT foi uma construção deliberada e de anos, não um projeto paralelo.
- O ChatGPT está testando ativamente, em produção, seu próprio índice contra resultados raspados de buscadores — de forma mais visível na área de shopping.
- O ChatGPT também faz cache de páginas em vez de buscá-las ao vivo a cada consulta, o que explica sua velocidade de resposta em escala.
- Google e Microsoft continuam relevantes: o ChatGPT usa pelo menos oito provedores externos além do próprio índice, incluindo Yelp, TripAdvisor e o Web IQ da Microsoft.
O ChatGPT tem uma família própria de índices
Por dois meses, o ChatGPT revelou de onde vinham seus resultados. Entre 21 de maio e 21 de julho de 2026, um campo chamado result_source apareceu diretamente nos eventos server-side do ChatGPT. Ele só assumia quatro valores: Labrador, Bright, Oxylabs e SERP. Três desses são provedores externos de raspagem de dados. O primeiro é o índice próprio da OpenAI.
Labrador não é um índice único — é uma família deles, e a maior parte não era conhecida publicamente até agora. Os índices identificados se dividem por categoria: web geral; PDF; YouTube; notícias (com camadas separadas para o último dia, os últimos 7 dias e conteúdo mais antigo); arXiv; Wikipedia; local; finanças (incluindo um índice separado para PDFs); jurídico; saúde; shopping; e imagens. O índice Labrador armazena dados típicos de outros índices, como o do Google, incluindo conteúdo completo da página, data de rastreamento e data de publicação — a mesma estrutura que o Google levou duas décadas para construir: um índice web geral, mais um conjunto de índices verticais especializados por cima.
As vagas de emprego da OpenAI confirmam o índice do ChatGPT
Vagas publicadas pela OpenAI reforçam a evidência de um índice próprio. Uma vaga para Software Engineer, Foundations Search pede experiência em “projetar e operar sistemas de indexação, pipelines de recuperação e camadas de serviço” — um pedido claro por uma stack específica. A vaga de Engineering Manager, Online Data Systems vai além: o time de Online Data, segundo sua própria descrição, “constrói e opera o banco de dados online principal e os serviços de indexação” por trás dos produtos de produção da OpenAI, incluindo o ChatGPT — atuando em escala multirregião, multi-cloud, em exabytes (10¹⁸ bytes, ou um 1 seguido de 18 zeros), e conduzindo os sistemas de banco de dados hiperescaláveis, tecnologias de indexação e busca vetorial da empresa. Não é a escala que se constrói para um sistema que apenas repassa consultas para o índice de outra empresa.
Há ainda uma vaga voltada para recuperação por embeddings, que pede explicitamente “projetar novos objetivos de treinamento de embeddings, arquiteturas escaláveis de vector store e métodos de indexação dinâmica”, com trabalho em representações densas, esparsas e híbridas. Representação esparsa é a linguagem do TF-IDF e do BM25 — o ranqueamento léxico sobre o qual o próprio Google foi construído. Combinada com embeddings densos, essa é exatamente a base para rodar Reciprocal Rank Fusion (RRF), mecanismo de fusão de resultados documentado primeiro por Metehan Yesilyurt, pesquisador de GEO da Peec AI.
A ligação com o testemunho antitruste de 2024
O índice do ChatGPT não é um projeto novo — remonta ao início de 2024, época em que o próprio Google constatou que sistemas RAG reduzem alucinações. O ChatGPT precisava de um provedor de busca para construir seu índice por cima. No julgamento antitruste do Google, Nick Turley, head do ChatGPT, testemunhou sob juramento sobre exatamente essa busca: disse que a OpenAI teve “problemas significativos de qualidade” com os dados de busca vindos de parceiros de API que não eram o Google, e que a OpenAI queria trabalhar com o Google nesse momento — mas o Google recusou a oferta. Isso explica por que a OpenAI precisou de um plano B: construir um índice internamente.
Segundo Turley, a OpenAI começou a construir seu próprio índice de busca em 2023, com a meta de responder 80% das consultas a partir dele até o fim daquele mesmo ano — um prazo extremamente agressivo para quem partia do zero. O mesmo testemunho traz um número bem diferente: mesmo com acesso total aos dados do índice do Google, levaria pelo menos cinco anos só para determinar se responder 100% das consultas com índice próprio é sequer viável. Um horizonte bem mais longo que a meta original de 80% até o fim de 2023. Independência total de provedores externos não é algo que se liga de uma vez — é uma transição gradual, testada consulta por consulta, sem garantia de chegar lá por completo. A estratégia parece ter sido a mesma desde o início: usar provedores externos como o Google para decolar, e ano a ano depender mais do índice próprio. O ChatGPT ainda não roda só com pipelines próprios, mas a direção é clara.
O shopping do ChatGPT é a evidência mais visível
Quem quiser ver o índice próprio da OpenAI em ação em tempo real deve olhar para o shopping. Em meados de agosto de 2026, um experimento A/B chamado “prefer-index-over-serp-v3” afetava 8% das conversas — a OpenAI já testa o índice próprio em fatias de tráfego que vão de dígitos únicos a 20%. A stack por trás dele combina um componente léxico BM25, que reduz o campo a 10 fontes para ranqueamento; um reranqueador de um pool de 400 candidatos (rerank400); um pool de entrada de 400 produtos (prod400); e busca vetorial por vizinho mais próximo aproximado, em duas dimensões diferentes, 12.288 e 4.096 (ann4096).
Em 2 de setembro de 2026, pelo menos cinco experimentos de shopping continuavam rodando em produção: prefer-index-over-serp-v3, chatgpt-shopping-noamazon, shopping-index-q2qb, shopping-hqi-v2 e shopping-hq-v1 — sendo que prefer-index-over-serp-v3 e shopping-index-q2qb rodam confirmadamente sobre o índice próprio do ChatGPT. Cinco experimentos ativos, todos testando variações do índice contra tráfego real de shopping, apontam para um time construindo e validando ativamente um índice de produtos.
O ChatGPT também faz cache de páginas
Buscar ao vivo a cada consulta é lento demais para a escala do ChatGPT — segundo o HTTP Archive Almanac, 58% das páginas levam mais de 0,8 segundo para carregar. Isso, mais a ocorrência eventual de erros de servidor, não é viável nessa escala. Um site de teste com um bilhão de páginas, publicado especificamente para medir o rastreamento do ChatGPT, teve 6 milhões de páginas rastreadas até o início de setembro de 2026, a um ritmo de 35 mil requisições por hora — rastreamento agressivo que só faz sentido se as páginas forem armazenadas em algum lugar. Um teste com o modo lockdown do ChatGPT (que não navega páginas ao vivo, mas retorna resultados salvos) confirmou isso: ao pedir a “versão mais recente” da home de veículos como Search Engine Journal, Search Engine Land e Search Engine Roundtable, o ChatGPT não buscou as páginas ao vivo — serviu versões do próprio cache.
O ChatGPT usa múltiplos provedores além do índice próprio
O ChatGPT não substituiu totalmente a busca clássica — ainda usa múltiplos provedores para alimentar seu índice, incluindo Google e Microsoft. Um teste controlado, feito por Malte Landwehr (CPO da Peec AI) com um site sem tráfego orgânico algum, mostrou picos de tráfego no Google Search Console exatamente nos dias em que o ChatGPT foi consultado sobre esse site — evidência direta de que o ChatGPT ainda consulta o Google ao fundamentar respostas. O Bing também aparece, principalmente em Deep Research, conforme sinalizado por David Konitzny, pesquisador de GEO da Peec AI, no LinkedIn. E a própria Microsoft confirma que o Web IQ, sua plataforma de grounding (com latência P95 abaixo de 165ms), já alimenta o ChatGPT diretamente, ao lado do Copilot e de clientes corporativos como a Nasdaq.
Juntando todos os provedores identificados na investigação, o ChatGPT costura pelo menos oito fontes: o próprio rastreador, independente de qualquer buscador externo; Bright (provavelmente Bright Data), que raspa resultados web do Google e, separadamente, o Google Maps para listagens locais; Oxylabs, que raspa o Google e alimenta especificamente a vertical de notícias; um terceiro canal de raspagem de SERP, também usado para notícias e para uma versão mista de resultados locais; Yelp; TripAdvisor; dois pipes internos não identificados (b1 e b3), sendo b1 responsável por sites de negócios e páginas do Facebook, e b3 por rotear para o Google Maps; e o Web IQ da Microsoft.
Visão Estratégica da Web Estratégica
Google e Microsoft continuam relevantes — há evidência direta de que o ChatGPT ainda usa os dois. Mas o ChatGPT também tem seu próprio repositório de recuperação, sua própria família de índices, sua própria stack de ranqueamento e sua própria camada de cache, e está contratando ativamente para expandir tudo isso.
- Diagnostique sua presença fora do Bing: pare de assumir que visibilidade no Bing é proxy de visibilidade no ChatGPT — a sobreposição é menor do que parece, e parte do que se atribui ao Bing pode, na verdade, estar passando pelo Web IQ da Microsoft, um produto diferente, com propósito diferente.
- Se a sua marca vende produtos, acompanhe especificamente como ela aparece nos resultados de shopping do ChatGPT — é onde o avanço do índice próprio está mais visível hoje, afetando diretamente a seleção de produtos exibidos.
- Se listagens locais importam para o seu negócio, priorize Yelp e TripAdvisor, tratados como parceiros licenciados; os dados do Google Maps chegam ao ChatGPT de qualquer forma, mas sem que você tenha controle sobre como são usados.
- Teste o modo lockdown do ChatGPT para entender se suas páginas mais importantes já estão no cache — e, se não estiverem, isso é um sinal de que vale revisar a frequência e a profundidade do rastreamento que seu site recebe.
Diagnostique seu potencial de visibilidade fora do Google e do Bing e entenda como sua marca aparece hoje nos diferentes índices que alimentam o ChatGPT.

