Ir para o conteúdo
Profissões.org.br

A engenharia por trás do atlas

Uma profissão não cabe em um único número

Por isso, não importamos um ranking pronto nem reduzimos o trabalho a um palpite sobre o futuro. Reconstruímos cada profissão a partir do Brasil, conectamos sua linguagem ao mundo e examinamos o que acontece no nível em que a mudança realmente começa: suas atividades.

Ocupações brasileiras preservadas
2.694
Relações examinadas na matriz global
13.470
Atividades lidas pelo modelo de catálogo
166.408
Ocupações sob avaliação aprofundada
2.471

1. O problema

Os dados existem. O difícil é fazê-los conversar sem distorcer nenhum deles

Uma classificação descreve ocupações. Outra descreve tarefas. Um banco observa vínculos; outro, movimentações. Estudos internacionais usam universos próprios. Modelos leem linguagem, mas não conhecem sozinhos o limite de uma afirmação. Tratar tudo isso como se fosse a mesma coisa produz números simples — e conclusões frágeis.

Nossa metodologia começa justamente nessa separação. Cada resultado conserva sua natureza, sua origem e seu grau de evidência até chegar à página de uma profissão. É a diferença entre exibir um score e construir uma referência.

O que observamos

A realidade brasileira

CBO, RAIS e Novo CAGED preservam classificação, estoque, fluxo, período e jurisdição.

O que construímos

Pontes entre mundos

Taxonomias, atividades, modelos e índices se conectam sem transformar rota derivada em verdade oficial.

O que ainda não sabemos

Incerteza explícita

Ainda não avaliado mantém aberta uma investigação sem fingir que ela já chegou a uma resposta.

O que não corresponde

Ausência também é resultado

Sem correspondência registra que a busca terminou sem uma equivalência sustentável.

2. O sistema

Seis camadas antes de uma conclusão

O que parece uma resposta direta na interface é o final de uma arquitetura longa. Cada camada resolve um tipo de problema e entrega à próxima apenas aquilo que conseguiu sustentar.

Nenhuma fonte contém essa visão pronta. Ela só aparece quando as camadas trabalham juntas.

  1. 01 Brasil primeiro A CBO preserva as 2.614 ocupações do país. O universo inteiro entra antes que qualquer exemplo seja escolhido.
  2. 02 Mercado real RAIS observa estoque anual; Novo CAGED observa fluxo mensal. Cada denominador continua sendo o que é.
  3. 03 Tradução global A CBO é conectada a 13 classificações internacionais com rota, release e decisão terminal.
  4. 04 Trabalho concreto Atividades são recuperadas e comparadas sem confundir proximidade de palavras com equivalência de trabalho.
  5. 05 Impacto da IA Um modelo cobre o catálogo; uma segunda camada aprofunda atividades com rubrica e consenso independentes.
  6. 06 Direito de publicar Cobertura, estabilidade, proveniência e linguagem passam por gates antes de aparecer ao público.

3. Uma linguagem global

Cada profissão brasileira dentro de um mapa internacional

Estudos globais não falam CBO. Para tornar suas evidências úteis no Brasil, construímos uma matriz que examina cada ocupação contra 14 classificações — sem apagar diferenças de escopo, versão ou país.

Aqui, cobertura não significa forçar uma correspondência. Significa não perder nenhuma ocupação no caminho: cada célula termina como oficial, candidata, sem correspondência ou ainda não resolvida.

T = |CBO| × |bancos| = 2.694 × 5 = 13.470

C_terminal = (N_oficial + N_derivado + N_sem_match + N_não_resolvido) / T
           = (2.694 + 0 + 0 + 0) / 13.470
           = 100,00%

M_total   = (N_oficial + N_derivado) / T = 20,00%
M_externo = N_derivado / (2.694 × 5) = NaN%
O detalhe que muda a leitura: 100% significa que nenhuma ocupação desapareceu do processo. Os 20,00% indicam células com candidato positivo — não uma promessa artificial de equivalência universal.

4. Da palavra à equivalência

Similaridade encontra possibilidades. Critério decide o que merece avançar

Palavras parecidas podem descrever trabalhos diferentes. Por isso, nosso matcher usa o contexto ocupacional para reduzir o universo, ordena candidatos com uma função lexical inspirada em BM25 e reserva a decisão de equivalência para um gate separado.

s(q,d) = Σ[t∈uniq(q)∩d] log(1 + (N − dfₜ + 0,5)/(dfₜ + 0,5)) × tfₜ/(tfₜ + 1,2)

       + 1,5 × I[primeiro token de q aparece nos 4 primeiros tokens de d]

O score acima não é apresentado como confiança. Ele apenas organiza a investigação. Quando a recuperação lexical é insuficiente, o fallback semântico amplia a busca — sem relaxar o critério de publicação.

agreement = |{p : decisãoA(p) = decisãoB(p)}| / n

elegível(p) = acordo ∧ equivalente ∧ min(confA, confB) ≥ 0,80
aresta(a)   = arg min rank entre pares elegíveis da atividade a

PASS_ocupação = agreement ≥ 0,90 ∧ max fanout(task_id) ≤ 3

Duas decisões precisam concordar, a confiança mínima precisa sobreviver e cada atividade pode publicar no máximo uma aresta. Discordância não vira média. Baixa confiança não vira aproximação. O sistema se abstém.

5. IA no nível da atividade

A IA não transforma uma profissão inteira de uma só vez

Ela encontra tarefas digitais, repetíveis ou codificáveis antes de alcançar atividades físicas, ambíguas ou dependentes de julgamento. É por isso que nossa unidade de análise não termina no título ocupacional.

Trabalhamos em duas resoluções complementares: o catálogo oferece uma leitura ampla e estimada; o mapa por atividade examina cada tarefa com critérios multidimensionais e avaliações independentes.

Catálogo · classificação estimada

Amplitude sem perder consistência

xₐ = TFIDF_palavra ⊕ TFIDF_caractere
p(m|xₐ) = softmax(βₘ · xₐ)

eₐ = Σₘ p(m|xₐ) · αₘ
α = {0,12; 0,42; 0,72}

TF-IDF de palavras e caracteres alimenta uma regressão logística. Assim, 166.408 atividades-fonte recebem a mesma régua de classificação.

Mapa · consenso por atividade

Profundidade onde cada detalhe importa

d₁…d₆ ∈ {0,1,2,3,4}
G = √(d₁ · d₆) / 4
C = (d₂ + d₄ + d₅ + (4 − d₃)) / 16
e = G · C

automação   ⇔ e ≥ 0,60
ampliação   ⇔ G ≥ 0,50 ∧ 0,25 ≤ e < 0,60
humano      ⇔ caso contrário

Digitalidade, codificabilidade, julgamento, erro, aceitação social e dependência física entram na mesma decisão. A tecnologia possível é separada da transformação plausível do trabalho.

113.592

atividades (catálogo) · predominância humana

47.186

atividades (catálogo) · ampliação

5.630

atividades (catálogo) · automação técnica

6. Índice e evidência

A nota mostra quanto do trabalho a IA alcança

O Índice de IAtização soma as atividades de trabalho em que a IA atua sozinha e aquelas em que atua com uma pessoa, divide pelo núcleo de trabalho (n atividades) e converte o resultado para a escala 0–100. Competências pessoais e comunicação transversal ficam fora desse denominador. A nota só é publicada quando a camada de evidência sustenta o cálculo. Sem isso, a profissão continua publicada sem número; o tier informa se uma nota veio do mapa específico ou do classificador de catálogo.

Iᵢ = 100 × (n_IA + n_IA+humano) / (n_IA + n_IA+humano + n_humano)

fonteᵢ = trilha principal, se o mapa por atividade específico passa pelo gate público
       = trilha estimada, se a classificação estimada de catálogo passa pelo gate público
       = estimativa residual, no residual sem classificação direta; diagnóstico interno, não nota pública

T3ᵢ = média dos índices T1 da família CBO; depois subgrupo; por fim, média nacional

AIOE, O*NET e WRTMJ = evidências de apoio separadas; não entram na fórmula de Iᵢ
Iᵢ · Índice de IAtização
Mede a parcela das atividades em que a IA atua sozinha ou com participação humana. Contagem, denominador, versão do método e hash permitem reconstruir a nota.
Tᵢ · tier da evidência
T2 é o mapa específico de maior profundidade; T1 usa atividades CBO classificadas; T3 é proxy residual tipado e não autoriza, sozinho, uma nota pública. Sinais internacionais fortalecem a explicação sem substituir o índice.
Auditoria do núcleo de trabalho de Contador

A página usa 65 atividades no cálculo. As 26 atividades abaixo descrevem competências pessoais ou comunicação transversal e ficam fora do denominador:

Enviar mensagens via correio eletrônico; Enviar boletins informativos; Elaborar folder; Ministrar palestras, seminários e treinamentos; Utilizar fax, telefone,internet e intranet; Divulgar e consultar manuais; Participar de entidades de classe; Participar de congressos, convenções e workshop; Prestar informações sobre balanços; Agir de forma educada; Demonstrar objetividade; Demonstrar conhecimentos básicos de informática; Raciocinar logicamente; Manter-se atencioso; Demonstrar flexibilidade; Zelar pelas informações; Manter-se atualizado; Trabalhar em equipe; Demonstrar conhecimento de outras línguas; Manter-se atualizado perante a legislação; Manter-se informado; Agir eticamente; Agir com discrição; Falar corretamente; Guardar sigilo; Agir com dinamismo.

7. Como provamos

Cada resposta precisa sobreviver ao caminho de volta

Não basta produzir um resultado. Precisamos conseguir reconstruí-lo: qual fonte entrou, qual versão estava ativa, que rota foi usada, onde houve discordância e por que a publicação foi autorizada.

Por isso, cobertura caminha ao lado de holdout, Macro-F1, concordância entre avaliações e conservação do universo. A sofisticação não está em ter mais casas decimais, mas em saber o que cada uma delas representa.

Holdout do catálogo
10
ocupações · 935 atividades
Macro-F1 do catálogo
65,9%
classes com o mesmo peso
Concordância mínima do mapa
0,0000
gate mínimo: 0,70
Concordância média do mapa
0,0000
130.602 atividades avaliadas

A memória de cada decisão

  • Proveniência: fonte, versão, release e rota usada.
  • Decisão: disposição, critérios e motivo de abstenção.
  • Execução: protocolo, parâmetros, timestamp e identidade do modelo.
  • Integridade: hashes dos inputs, outputs e artefatos derivados.

8. Onde paramos

Precisão também é saber onde não avançar

Um sistema confiável não se mede apenas pelo que consegue responder. Mede-se também pelas conclusões que se recusa a fabricar. Estes limites acompanham toda leitura publicada no atlas.

  • Causalidade Os indicadores não provam que a IA causará desemprego, queda salarial ou desaparecimento de uma profissão.
  • Probabilidade individual Scores ocupacionais não estimam o destino de uma pessoa, empresa ou vaga específica.
  • Equivalência perfeita Um candidato internacional positivo não é, por si só, validação independente de equivalência semântica.
  • Adoção observada Exposição técnica descreve capacidade potencial. Uso real, custo, regulação e aceitação social exigem outras evidências.
  • Independência absoluta Dois modelos ou execuções reduzem instabilidade, mas podem compartilhar vieses de dados e de desenho da rubrica.
  • Atualização instantânea RAIS, CAGED e classificações têm vintages diferentes; toda leitura deve considerar o período de cada fonte.

Veja a metodologia trabalhando

A prova final está no que ela permite enxergar

Abra uma profissão e observe como mercado, atividades, referências internacionais e impacto da IA deixam de ser informações soltas para formar uma leitura única — ainda que cada evidência preserve sua identidade.

Métricas calculadas no build a partir dos artefatos vigentes. Modelo de catálogo: catalog-tfidf-logreg-v2. Matriz de paridade: parity-disposition-v1. Última revisão editorial: 14 de julho de 2026.