Importante: A IA não inventa, não faz diagnóstico e não prescreve. Ela é um assistente de escrita para agilizar seu tempo e dar mais atenção para o paciente.

A avaliação do impacto real de uma tecnologia de saúde exige indicadores precisos, reprodutíveis e clinicamente relevantes. No caso de ferramentas de apoio à documentação clínica com Inteligência Artificial, três categorias principais de medidas de desfecho oferecem uma visão abrangente do impacto: eficiência temporal, qualidade de registro e percepção subjetiva do profissional.

1. Eficiência Temporal

O tempo médio de preenchimento do prontuário por consulta é a medida de desfecho mais objetiva e facilmente mensurável. Pode ser coletado por cronometragem direta ou por análise de metadados do sistema de prontuário (timestamps de abertura e fechamento do registro).

Estudos de avaliação de sistemas de transcrição automática relatam reduções de 30% a 80% no tempo de digitação, dependendo do contexto clínico e da complexidade dos casos atendidos.

2. Qualidade dos Registros Clínicos

A qualidade do prontuário pode ser avaliada por meio de critérios estruturados aplicados por avaliadores independentes (médicos especialistas em documentação clínica), utilizando checklists que verificam a presença e completude dos elementos obrigatórios do SOAP:

  • Subjetivo: qualidade e completude da descrição da queixa e anamnese.
  • Objetivo: presença e relevância dos achados do exame físico registrados.
  • Avaliação: clareza e especificidade das hipóteses diagnósticas.
  • Plano: detalhamento das condutas, prescrições e orientações ao paciente.

3. Escala SUS (System Usability Scale)

A SUS é o instrumento padrão para mensurar a percepção de usabilidade de sistemas computacionais por seus usuários. Composta por 10 afirmações com escores de 1 a 5 (Likert), gera uma pontuação final de 0 a 100. Escores acima de 68 são considerados "bons"; acima de 80, "excelentes".

"A percepção de facilidade de uso por parte do médico usuário é, em si mesma, uma medida de desfecho clinicamente relevante — pois sistemas percebidos como difíceis tendem a ser subutilizados ou abandonados." — Brooke, J., 1996

4. NASA-TLX: Carga de Trabalho Percebida

O NASA Task Load Index (NASA-TLX) avalia seis dimensões da carga de trabalho percebida: demanda mental, demanda física, demanda temporal, desempenho, esforço e frustração. Sua aplicação antes e após a adoção de uma ferramenta de documentação fornece dados robustos sobre o impacto na qualidade de vida profissional.

Perguntas Frequentes sobre Desfechos e Pesquisa

Onde posso encontrar a Escala SUS para aplicar em estudos de usabilidade?

A Escala SUS é de domínio público e pode ser encontrada na publicação original de Brooke (1996) ou em repositórios científicos como o ResearchGate. Há também versões validadas e adaptadas para o português disponíveis na literatura científica nacional.

Qual a diferença entre eficácia e efetividade na avaliação de tecnologias médicas?

Eficácia mede o desempenho de uma tecnologia em condições controladas de pesquisa (estudo piloto). Efetividade mede seu desempenho no mundo real, com suas variabilidades e limitações. Ambas as medidas são importantes para uma avaliação completa.