Como sabemos o que sabemos, e admitimos o que não sabemos.
Não pedimos que você confie em uma caixa-preta. Esta página mostra os referenciais empíricos sobre os quais nossas mentes simuladas são construídas, como medimos a estabilidade de cada resultado, e as três razões pelas quais informamos uma direção em vez de um decimal.
Quem são as mentes
Populações parametrizadas por referenciais culturais e psicográficos documentados.
Quão estável é o ranking
Não executamos uma vez só. Executamos a população muitas vezes e medimos a dispersão.
Se ele sobrevive a um mundo em mudança
O vencedor continua vencendo quando o contexto externo muda?
TRÊS EIXOS INDEPENDENTES DE INCERTEZA · CADA UM COM SUA PRÓPRIA LINHA NO SELO DE EVIDÊNCIA
A população não é genérica. Ela é construída sobre referenciais publicados.
Quando você escolhe um público, suas mentes simuladas são parametrizadas com dimensões culturais documentadas, de modo que a simulação aplica diferenças interculturais conhecidas ao seu segmento, em vez de adivinhar. O modelo em uso vem impresso em cada resultado.
Começamos com Hofstede (dimensões nacionais), no ar hoje. Os valores básicos de Schwartz para segmentos dentro de um país e a calibragem com o World Values Survey são os próximos no registro de mudanças somente-adição, e cada um chega com sua própria entrada, datada.
Limite honesto, declarado no selo: Hofstede descreve nações de forma agregada, não indivíduos. Ele parametriza a direção, nunca autoriza uma porcentagem exata. Apenas dados reais no padrão do WVS elevam CALIBRAGEM: NENHUMA para WVS WAVE 7.
Executamos a simulação cem vezes, não uma só.
Uma única execução pode dar sorte. Por isso reamostramos a população muitas vezes e observamos onde o ranking pousa. Se uma variante vence na maioria das execuções, a direção é estável. Se as execuções discordam, dizemos isso, como categoria (ALTA / MÉDIA / BAIXA), nunca um decimal falso.
Este é o método de conjunto (ensemble) que os serviços de meteorologia usam: muitas previsões, lidas como uma dispersão, não como uma linha única. O leque é o ponto central.
Você recebe uma nova linha no selo, ESTABILIDADE DO RANKING: 78/100, e uma faixa de CONFIANÇA em linguagem simples. Um leque estreito significa confiar na ordem; um leque largo significa testar antes de se comprometer.
Validação cega, depois calibragem. Do real para a simulação, nunca o contrário.
Antes que um resultado ancorado seja mostrado, o oráculo é testado às cegas: os nomes dos segmentos são anonimizados, o oráculo os ordena, e seu ranking é comparado com o que os dados de fato dizem, na forma de uma correlação de postos de Spearman. Esse número é impresso no selo como o backtest.
Onde existem resultados reais, calibramos: um mapa isotônico da propensão simulada para as taxas observadas, ajustado leave-persona-out para que não possa se lisonjear. A calibragem flui em uma única direção, da realidade para a simulação. A simulação nunca toca os dados de avaliação. Isso é a constituição §2 e §4, e é por isso que um degrau CALIBRATED significa algo.
Um vencedor que só vence em um futuro não é um vencedor.
Reexecutamos seu ranking em cenários-limite, uma retração, um cenário-base estável, uma expansão, e verificamos se a ordem se mantém ou se rompe. Uma mensagem que fica em primeiro em todos os cenários é robusta. Uma que só vence nos bons tempos é um alerta, impresso com clareza.
A herança aqui é o clássico planejamento de cenários (Shell / Global Business Network): você não prevê um único futuro, você submete uma decisão à prova contra vários.
Para um fundador diante de um investidor, "nossa mensagem vencedora é robusta em três cenários macroeconômicos" é uma afirmação muito mais forte do que um único número, e é uma afirmação que realmente conseguimos defender.
O selo de evidência, por completo.
Todo resultado vem com isto. Foi modelado como um rótulo nutricional: campos fixos, na mesma ordem sempre, para que você aprenda a lê-lo uma vez só. A cor marca o estágio epistêmico, vermelho é simulação, verde é calibragem com dados reais.
Repare no que o selo se recusa a conter: uma porcentagem de conversão. Não existe campo para isso, porque sem os seus resultados reais não conseguimos preenchê-lo com honestidade.
O que ele contém são coisas que conseguimos defender sob escrutínio: o enquadramento, a dispersão, a robustez, a classe de backtest e a amostra. A ausência de um número é, por si só, informação.
CLASS B PASS = ρ de Spearman cego ≥ 0.5 na dimensão validável da execução.
CLASS A PASS = ρ ≥ 0.7 em três ou mais validações cegas no domínio.
Impresso a partir do artefato da execução (sim_validation.json), nunca escrito à mão.
Três razões, e a mais profunda não é estatística.
Empírica
Trabalhos revisados por pares mostram que os modelos de linguagem não reproduzem de forma confiável a psicologia humana. Previsões absolutas se desviam; os decimais parecem precisos e não são.
Metodológica
Mesmo o melhor planejamento não prevê: ele mede quão estável é uma direção entre execuções e cenários. O conjunto (ensemble) e a dispersão de cenários são essa medida, tornada visível.
Filosófica
A realidade é um processo, não uma coisa: ela flui. Perseguir um número certo sobre o futuro confunde a própria natureza do futuro, que nunca foi um objeto que você pudesse acertar como um alvo. Uma ferramenta que informa direção está alinhada com o modo como o mundo de fato se comporta, não é apenas cautelosa.
"Você é uma função do que o universo inteiro está fazendo, do mesmo jeito que uma onda é uma função do que o oceano inteiro está fazendo.", segundo Alan Watts
Movido pelo Windrose Engine.
O mesmo instrumento, populações simuladas, conjuntos (ensembles), selos de evidência, por baixo de cada estudo que construímos. O teste de mensagem é o primeiro de uma série. A mesma espinha dorsal também responderá a máquinas: os agentes chamarão o engine via MCP e receberão os mesmos selos, assinados. Veja Para agentes.
○ Sensibilidade a preço · ○ Abandono no onboarding · ○ Reação a crise & PR · ○ Construtor de personas · ○ Relatório de estabilidade para conselhos
Quando o método muda, mostramos a mudança.
Nada aqui é sobrescrito. Uma decisão substituída continua visível, com sua sucessora ao lado, a mesma disciplina que mantemos internamente.
Adicionadas as linhas MODELO CULTURAL, ESTABILIDADE DO RANKING, CONFIANÇA e ROBUSTEZ DE CENÁRIO. Substitui o selo de cinco campos.
Os rankings agora são informados sobre 100 reamostragens, em vez de uma única execução, produzindo o índice de estabilidade.
RUNG, CALIBRATION, SCOPE, BACKTEST, N SAMPLES.