Nos dois artigos anteriores (artigo 1 e artigo 2): por que o maior erro sobre IA é começar pela própria IA, e por que a mesma régua que decide autonomia de um agente também decide quando um experimento vira projeto. Este fecha a trilogia com a pergunta mais desconfortável das três: como saber se sua empresa está realmente avançando — ou só comprando mais ferramenta.
Pergunte ao comitê executivo da sua empresa em que estágio de maturidade de IA vocês estão. A resposta quase sempre vem em tom de orgulho moderado: “avançados”, “no meio do caminho”, “não os primeiros, mas longe de estar atrás”.
Pergunte de novo depois de aplicar as nove perguntas deste artigo. O número cai — quase sempre. Não porque a empresa regrediu. Porque a primeira resposta media quantas ferramentas de IA a empresa usa, e com que entusiasmo. A segunda mede se alguma coisa mudou de verdade: workflow reconstruído, decisão redistribuída, resultado financeiro que sobrevive a uma auditoria cética.
Essas duas coisas não são a mesma. Confundir uma pela outra é o erro mais caro desta série — porque não aparece em nenhum piloto, em nenhuma demonstração. Só aparece um ano depois, no relatório que ninguém queria escrever.
O que este artigo argumenta
Existem duas escadas de IA, e a maioria confunde uma com a outra:sofisticação tecnológica(que tipo de IA você usa) ematuridade de valor(quanto disso virou resultado real).
A armadilha mais comum: uma empresa pode ter 90% de adoção de um chatbot e continuar presa no primeiro degrau da escada de valor. Adoção não é profundidade.
A escada de valor tem sete degraus, de Assist a Transform — e os quatro sistemas descritos nesta série não estão todos no topo. Aplico a régua a mim mesmo antes de aplicar a você.
MIT CISR, Gartner e IBM convergem: o maior salto financeiro não acontece na adoção, acontece na transição de pilotos isolados para forma de trabalho escalada — e só 7% das empresas chegam ao estágio mais alto.
Automação e aumento humano não são escolhas opostas — são interdependentes no tempo (Raisch & Krakowski, Academy of Management Review, 2021). E o ROI real de IA costuma levar de dois a quatro anos para aparecer, não um trimestre.
O artigo fecha como teste de 9 perguntas— a ferramenta prática que você pode rodar hoje mesmo na sua empresa, e encaminhar para quem vai apresentar “maturidade de IA” na próxima reunião de board.
Duas escadas, uma confusão cara
Existe uma escada que mede sofisticação tecnológica — do prompt individual ao agente autônomo, do copiloto ao robô. Ela descreve bem o que a tecnologia faz em cada degrau. O problema é usá-la como se fosse a escada que importa para o negócio. Uma empresa pode estar no degrau “agentes”, ou até “sistemas multiagente” — tecnicamente avançada — e seguir presa no primeiro degrau de qualquer escada que meça resultado. São dois eixos diferentes. E a maioria dos comitês executivos só enxerga o primeiro, porque é o que aparece em demonstração.
A armadilha da métrica de adoção
Aqui está a versão mais afiada desse erro — e a mais fácil de cometer sem perceber. Uma empresa pode ter 90% dos funcionários usando ativamente um assistente de IA, número que qualquer comitê exibiria com orgulho, e continuar no primeiro degrau da escada de valor: o degrau em que a IA só ajuda alguém a fazer a mesma tarefa de sempre, um pouco mais rápido. Enquanto isso, outra empresa com poucos usuários, mas um único processo crítico redesenhado do zero, pode estar gerando impacto real no resultado. Mesma tecnologia. Resultado completamente diferente.
A métrica que engana comitês inteiros
O que o comitê vê: “90% de adoção do assistente de IA” — parece maturidade.
O que a métrica não revela: se esse uso mudou algum workflow, redistribuiu alguma decisão, ou só acelerou a mesma tarefa de sempre em alguns minutos por dia.
Percentual de usuário ativo precisa vir acompanhado de profundidade de workflow, benefício econômico atribuível e mudança de capacidade organizacional — sem isso, é uma métrica de engajamento disfarçada de métrica de maturidade.
Aplicando agora · mesmo grupo, mesmo desafio
A armadilha da métrica de adoção apareceu, em miniatura, no mesmo grupo que mentoro no ITA Challenge Sprint (artigo anterior desta série). O material de prática do desafio — dados fictícios, fornecidos pelo programa — trazia um “score de referência” já pronto, do tipo que, numa reunião de comitê, passaria por maturidade. Testado contra os poucos resultados já conhecidos no próprio material, esse placar discriminava tão pouco quanto cara ou coroa (0,52 numa escala em que 0,50 é aleatório e 1,0 é perfeito). Isso não prova nada sobre o mercado real — os dados são de treino, não de produção. Prova algo mais barato de aprender numa sala de aula do que numa reunião de board: um placar nunca confrontado com resultado real não é maturidade. É opinião com casas decimais.
A escada de valor, degrau por degrau
Uma escada mais útil não pergunta “quanta gente usa” — pergunta “que tipo de mudança essa IA produziu”. Ela tem sete degraus, e nenhum sistema desta série está automaticamente no topo só porque eu o construí. Vou aplicar a régua aos próprios casos que venho contando, com a mesma disciplina que pediria de qualquer outra empresa.
Figura 1 - A escada de valor da IA (Trentim, 2026).
Reparem no que essa autoavaliação honesta revela: Qeevo OS e JUR.OS estão em REDESIGN (degrau 4) — o processo foi reconstruído do zero, não apenas acelerado, e isso é visível em métrica que qualquer CFO reconhece (fechamento em D5, exposição de risco caindo 88,7%). FOQA News chega a INNOVATE (degrau 6) porque deixou de ser processo interno para virar produto de informação com experiência própria — curadoria com IA, leitor conversacional. E Content.OS, deliberadamente, ainda está em AUTOMATE (degrau 2): resolve uma tarefa bem delimitada, com números que são projeção de MVP, não resultado maduro. Colocá-lo no mesmo degrau dos outros três seria exatamente o tipo de otimismo prematuro que esta série vem criticando desde o primeiro artigo.
O que a evidência mundial diz sobre essa escada
O MIT Center for Information Systems Research propõe quatro estágios de maturidade — Experiment and Prepare, Build Pilots and Capabilities, Develop AI Ways of Working, Become AI Future Ready — medidos por desempenho financeiro relativo ao setor. Em 2024, apenas 7% das empresas estavam no quarto estágio. Na atualização de 2025, o dado mais importante não foi o topo: foi que o maior salto de impacto financeiro acontece na passagem do segundo estágio (pilotos e capacidades) para o terceiro (formas de trabalho escaladas) — exatamente a travessia que a maioria das empresas nunca completa.
Gartner e IBM chegam a conclusões convergentes por caminhos diferentes: Gartner organiza maturidade em estratégia, valor, organização, governança, engenharia e dados, com estágios de “foundational” a “transformational”; a IBM descreve cinco fases de adoção de GenAI, saindo de uso genérico e disperso rumo a governança, dados corporativos e aplicações integradas. Nenhum dos três mede número de licenças. Todos medem a mesma coisa, com nomes diferentes: capacidade repetível de transformar problema em valor, com governança.
Automação e aumento humano não são opostos
Um erro comum de quem lê a escada de valor é achar que subir degraus significa substituir cada vez mais gente por IA. Sebastian Raisch e Sebastian Krakowski, num artigo influente na Academy of Management Review, argumentam o contrário: automação e aumento humano não são polos que se escolhe entre si. São interdependentes no tempo. Automatizar uma tarefa libera uma pessoa para julgamento, exceção, relacionamento ou desenho — que depois pode, ele mesmo, ser parcialmente automatizado no próximo ciclo. Insistir num dos dois polos, sozinho, gera ciclos que se reforçam com resultados ruins para a organização.
Isso conecta com uma virada de perspectiva útil, defendida pela OCDE: a unidade certa de análise não é o cargo, é a tarefa. Um “gerente de projetos” não desaparece porque uma IA aprendeu a produzir ata de reunião — a tarefa de produzir ata migra para a IA, e o que sobra (negociar prioridade, resolver conflito, assumir responsabilidade) é exatamente o que fica mais valioso, não menos. Decompor um cargo em tarefas, mapear onde a fronteira da IA está forte e onde está fraca, e só depois recompor os papéis, evita tanto o otimismo ingênuo quanto o pessimismo apressado sobre o futuro do trabalho.
Por que os primeiros degraus parecem um fracasso — mesmo quando não são
Uma parte do desconforto executivo com a escada de valor vem de uma expectativa errada sobre tempo. Erik Brynjolfsson, Daniel Rock e Chad Syverson documentaram um padrão que se repete desde a eletrificação industrial: tecnologias de propósito geral exigem investimento intangível complementar — novo processo, novo modelo de negócio, capacitação — que raramente aparece nas métricas contábeis tradicionais, mesmo quando já gera valor real. O resultado é uma “curva J”: produtividade parece estagnada ou até piora no início, e só se revela depois, quando o intangível acumulado começa a ser colhido.
A implicação prática: um piloto de IA que não mostra retorno no primeiro trimestre não é necessariamente malsucedido. Pode estar exatamente no ponto da curva J em que a maioria desiste — não por ter escolhido mal, mas por medir cedo demais, com a régua errada.
O que realmente custa dinheiro
A Deloitte documentou, em pesquisa recente na Europa, que o payback típico de iniciativas de IA generativa fica entre dois e quatro anos — muito acima da expectativa comum de retorno rápido que qualquer novidade tecnológica costuma gerar. Isso não é motivo para desistir; é motivo para exigir baseline e métrica antes do protótipo, não depois.
Figura 2 - As quatro dimensões de valor com IA.
O caso IKEA (Billie, o assistente que resolveu cerca de 47% das consultas de atendimento entre 2021 e 2023, liberando cerca de 8.500 atendentes para requalificação em design remoto e vendas complexas) é o exemplo mais citado de por que essas quatro famílias de valor não podem ser lidas isoladamente: o ganho de primeira ordem é redução de custo de atendimento; o de segunda ordem é a capacidade humana liberada; o de terceira é essa capacidade virando venda, design ou relacionamento que não existiria sem o redesenho. Ler apenas a primeira ordem — “quantas conversas o bot resolveu” — é a mesma armadilha da métrica de adoção, um degrau abaixo.
O teste de 9 perguntas — a ferramenta que fecha esta série
Chega de conceito. Aqui está a ferramenta: nove perguntas, uma por dimensão, cada uma exigindo evidência — não opinião de comitê. Leve para a próxima reunião, ou encaminhe para quem vai apresentar “maturidade de IA” na sua empresa.
Figura 3 - O teste das nove evidências para pilotos de IA.
Se a resposta honesta para mais de três dessas perguntas for “não sei”, a empresa está pelo menos um degrau abaixo de onde a última reunião de comitê presumiu.
Uma pergunta a mais, de brinde: quem, formalmente, é responsável por fazer essas nove perguntas e documentar a resposta com evidência — não de memória, não de achismo de corredor? Se a resposta for “ninguém, oficialmente”, isso não é falha sua. É assunto do próximo artigo desta newsletter, não deste.
Conexão · Hélice da Execução · Trentim (2026)
A escada de valor mede, na prática, a mesma coisa que Capacidade de Entrega mede na Hélice: não se a organização tem a ferramenta, mas se ela entrega o resultado prometido de forma sustentada. E a travessia mais difícil — do estágio 2 para o 3 no MIT CISR, de AUTOMATE para REDESIGN na escada de valor — exige exatamente o que Governança Enxuta descreve: controle recalibrado, não removido nem multiplicado, à medida que a IA deixa de ser piloto isolado e passa a fazer parte do processo padrão.
É a síntese dos três artigos desta série, vista de cima: não automatizar desperdício (artigo 1), calibrar autonomia pela reversibilidade em cada escala — tarefa, protótipo, portfólio (artigo 2) e medir profundidade real de mudança, não entusiasmo de adoção (este artigo) — são a mesma disciplina aplicada três vezes.
Síntese da série: A Fronteira da IA
1. Comece pelo problema, não pela ferramenta — “onde usar IA” garante desperdício acelerado; a pergunta certa é sobre o job to be done que ainda não se resolve bem.
2. Calibre autonomia pela reversibilidade, em toda escala — na tarefa de um agente, no protótipo que ainda não passou pelo golden set, no piloto prestes a virar orçamento fixo.
3. Meça a escada de valor, não a de adoção — o número que importa para o board não é quantas ferramentas de IA a empresa usa, é quanto disso já redesenhou trabalho, produto ou modelo operacional.
Esta trilogia cobriu adoção de IA para eficiência e processo interno — usando meus próprios sistemas como prova de que o princípio funciona antes de ser teoria. O próximo artigo desta newsletter sai do “o quê” e vai para o “quem”: nem o padrão de IA do PMI nem o guia de análise de negócios do PMI nomeiam com precisão quem deveria estar aplicando o teste de 9 perguntas acima, na prática, dentro da empresa. Duas edições já escritas tratam disso — uma sobre o papel que falta nomear, outra sobre a carreira que nasce dessa lacuna.
“The productivity J-curve... can explain the productivity slowdowns often accompanying the advent of GPTs, as well as the increase in productivity later.”— Brynjolfsson, E., Rock, D. & Syverson, C., NBER Working Paper 25148
Mario H. Trentim é conselheiro de administração, doutorando em Engenharia no ITA (2024–2029), e autor de 13 livros em gestão estratégica e execução. Construiu e opera os sistemas de IA descritos nesta série. Escreve semanalmente sobre estratégia, execução e governança em organizações complexas.
Esta newsletter não tem patrocinadores nem anúncios. Se esta série tem valor, a melhor forma de amplificá-la é encaminhar este artigo para quem vai apresentar o “estágio de maturidade de IA” da empresa na próxima reunião de estratégia.
Referências e fontes
MIT Center for Information Systems Research (CISR). Modelo de 4 estágios de maturidade de IA empresarial e desempenho financeiro relativo ao setor (2024-2025).
Gartner (2025-2026). Modelo de maturidade em IA — dimensões estratégia, valor, organização, governança, engenharia e dados.
IBM (2025). Cinco fases de adoção de GenAI empresarial.
Deloitte (2025). State of Generative AI — payback típico de dois a quatro anos, pesquisa europeia.
Raisch, S. & Krakowski, S. (2021). Artificial Intelligence and Management: The Automation-Augmentation Paradox. Academy of Management Review, 46(1), 192-210.
OECD. Adaptive problem solving e decomposição de tarefas (PIAAC) — unidade de análise para efeitos de IA no trabalho.
Microsoft & LinkedIn (2025). Work Trend Index — “2025: The Year the Frontier Firm Is Born”. 31.000 profissionais, 31 países.
Brynjolfsson, E., Rock, D. & Syverson, C. (2021). The Productivity J-Curve. American Economic Journal: Macroeconomics / NBER Working Paper 25148.
Britto, R. (IBS Americas). E-book Agentes de IA — escada de 5 níveis de sofisticação tecnológica.
Trentim, M.H. (2026). Hélice da Execução: Framework diagnóstico de capacidade organizacional. [W25, W38-W42 desta newsletter]
Trentim, M.H. (2026). Qeevo OS, JUR.OS, FOQA News, Content.OS — autoavaliação na escada de valor, dados internos verificados e projetados conforme indicado.
Trentim, M.H. (2026). ITA Challenge Sprint — mentoria de grupo, desafio Allya (AllevoTech/Qeevo), set-out/2026. Dados de prática fictícios fornecidos pelo programa.
📩 Estratégia em Ação · Newsletter semanal sobre execução, governança e organizações que aprendem mais rápido do que o mercado muda · substack.com/@mariotrentim





