Cérebro do Mentor Cérebro do Mentor ← Voltar ao site
Evidências

O benchmark cego: o que foi medido, como — e o que os números não dizem

A landing mostra os resultados. Esta página mostra o método, a tabela inteira e os limites do estudo.

Em 25/06/2026 comparamos o Cérebro do Mentor — no estudo de caso de uma profissional de saúde — a quatro modelos generalistas de grandes fornecedores, sobre as mesmas perguntas: 200 dentro de um corpus clínico curado e 75 fora dele, avaliadas por dois juízes cegos. O Cérebro foi mais fiel ao acervo (7,7 contra 2,3 do melhor generalista), mais rastreável (7,9 contra 1,0) e se absteve honestamente com muito mais frequência (97% contra 40%).

O que o estudo comparou?

Cinco sistemas responderam ao mesmo conjunto de perguntas, e as respostas foram avaliadas sem que os juízes soubessem qual sistema produziu cada uma. O desenho tem duas partes, e a segunda é a que costuma faltar em comparações de IA:

A análise usou intervalo de confiança de 95% e teste de Tukey HSD para comparação múltipla entre sistemas. O corpus é o acervo real de uma mentora de saúde — não um conjunto sintético montado para a ocasião.

A tabela completa

Sistema Fidelidade
0–10 ↑
Rastreabilidade
0–10 ↑
Alucinações
por pergunta ↓
Abstenção
honesta ↑
Cérebro do Mentor7,77,92,9697%
Modelo generalista A2,31,012,638%
Modelo generalista B1,50,715,185%
Modelo generalista C1,30,717,2340%
Modelo generalista D1,30,717,9216%

Benchmark cego · 25/06/2026 · n = 200 (corpus) + 75 (fora do corpus) · 5 sistemas · 2 juízes cegos

O que cada métrica significa?

O teste das entidades inventadas

Além das perguntas, o estudo apresentou aos sistemas 30 conceitos que não existem, como se existissem, para ver o que fariam.

Os modelos generalistas produziram descrições convincentes para esses conceitos inexistentes em 53% a 97% das vezes. O Cérebro do Mentor, em nenhuma das 30.

Este é o resultado mais direto do desenho: um sistema que só responde a partir de um acervo definido não tem de onde tirar a descrição de algo que não está lá — e sinaliza a lacuna em vez de preencher.

O que este estudo não prova

Os limites importam tanto quanto os números, e quem publica um benchmark sem eles está vendendo, não medindo.

Cinco ressalvas honestas:
  • Não dizemos “zero alucinação”. A taxa medida foi 2,96 por pergunta — menor que a dos generalistas, e diferente de zero. O “0 de 30” vale para aquele conjunto de entidades inventadas, não como garantia geral.
  • É um acervo, não o mercado. O corpus é o de uma mentora de saúde real. Outro acervo, com outra curadoria, pode render outro número — inclusive pior, se o material estiver desorganizado.
  • Os juízes são modelos de linguagem, não avaliadores humanos. Usar dois, de forma cega, reduz o viés de juiz único, mas continua sendo avaliação automatizada.
  • Os generalistas estão anonimizados (A–D) e são de junho de 2026. Modelos mudam rápido: o número tem data, e a data está declarada.
  • Nada disso é conformidade garantida, adequação à legislação nem segurança jurídica. Fidelidade e rastreabilidade são propriedades da resposta — quem responde perante o conselho ou regulador é o profissional.

Onde ler a íntegra

A metodologia completa, os dados e a análise estatística estão no whitepaper aberto: “Inteligência artificial curada por especialista na arquitetura Cérebro do Mentor: fidelidade, rastreabilidade e abstenção honesta frente a modelos de linguagem generalistas”.

Baixar o whitepaper (PDF) ↓

Como o sistema chega a esses números está descrito em engenharia: o acervo organizado em grafo por uma ontologia do conselho ou regulador, a extração local e a proveniência de cada afirmação. E o que acontece com os seus dados no caminho está em soberania de dados.