Glosario de términos de IA aplicada a la medicina

Glosario actualizado con 40+ términos de IA aplicada a medicina en 2026: desde NLP clínico hasta HIPAA. Referencia clara y práctica para profesionales sanitarios.

14 min de lectura

Ilustración editorial sobre glosario IA medicina — MedicMic

Glosario de términos de IA aplicada a la medicina

El 78% de médicos usa herramientas de IA clínica en 2026, según un estudio de JAMA Network Open. Pero la mayoría desconoce qué significa realmente "NLP médico" o "aprendizaje supervisado".

El problema no es la complejidad técnica intrínseca de estos conceptos, sino la ausencia de definiciones clínicamente contextualizadas. Los glosarios genéricos de IA ignoran cómo se aplican estos términos a la consulta, la historia clínica o el flujo de documentación. Los sanitarios necesitan entender qué hace la tecnología dentro de su práctica, no en abstracto.

Este glosario recoge más de 40 términos de IA médica con definiciones precisas, ejemplos clínicos reales y referencias a aplicaciones concretas en documentación, diagnóstico y flujo de trabajo. Actualizado en junio de 2026 para profesionales de atención primaria, especialidades y residentes MIR.


Términos fundamentales de inteligencia artificial en medicina

Inteligencia artificial (IA)

Capacidad de un sistema computacional para realizar tareas que tradicionalmente requieren cognición humana: reconocimiento de patrones, procesamiento del lenguaje natural, razonamiento clínico estructurado o toma de decisiones basada en datos. En medicina, la IA procesa imágenes radiológicas, analiza conversaciones médico-paciente o predice riesgo de sepsis en UCI.

Aprendizaje automático (Machine Learning, ML)

Subcategoría de IA donde el sistema aprende patrones a partir de datos sin programación explícita de reglas. En lugar de codificar "si glucemia >126 mg/dL en ayunas dos veces, entonces diabetes", el modelo analiza miles de historiales, identifica correlaciones entre glucemia, HbA1c, edad, IMC y diagnóstico, y construye su propia función predictiva. Los transcriptores médicos con IA entrenan con millones de consultas anotadas para aprender a estructurar el lenguaje clínico espontáneo.

Aprendizaje supervisado

Paradigma de ML donde el sistema aprende de ejemplos etiquetados por humanos. El dataset de entrenamiento contiene pares "entrada → salida correcta". Por ejemplo: 10.000 radiografías de tórax etiquetadas como "normal", "neumonía", "derrame pleural". El algoritmo ajusta sus parámetros para minimizar la diferencia entre su predicción y la etiqueta real. Una vez entrenado, clasifica radiografías nuevas sin etiquetar.

Aprendizaje no supervisado

El sistema busca patrones ocultos en datos sin etiquetas previas. Agrupa pacientes con perfiles similares de comorbilidades sin saber de antemano cuántos grupos existen ni qué los define. Útil en investigación clínica para identificar fenotipos de enfermedad o subgrupos de respuesta a tratamiento que los humanos no habíamos anticipado.

Aprendizaje por refuerzo

El modelo aprende mediante prueba, error y recompensas acumuladas. Se usa en sistemas de optimización de dosis de insulina: el agente propone ajustes, observa la glucemia del paciente en las horas siguientes, recibe "recompensa" positiva si el control mejora y negativa si empeora, y refina su política de ajuste. DeepMind aplicó refuerzo para optimizar radioterapia de precisión.

Red neuronal artificial (ANN)

Arquitectura de ML inspirada en neuronas biológicas. Capas de nodos interconectados procesan información secuencialmente: la capa de entrada recibe datos brutos (valores analíticos, palabras transcritas), capas ocultas extraen patrones de complejidad creciente, y la capa de salida emite la predicción o clasificación. Las redes profundas (deep learning) tienen decenas de capas ocultas.

Aprendizaje profundo (Deep Learning)

Subconjunto de ML basado en redes neuronales con múltiples capas ocultas. Aprende representaciones jerárquicas: en una imagen de retina, las primeras capas detectan bordes, las intermedias vasos sanguíneos, las finales microaneurismas. GPT-4 Medical usa arquitecturas de aprendizaje profundo con 1,76 billones de parámetros.


Procesamiento del lenguaje natural clínico

Procesamiento del lenguaje natural (NLP)

Rama de IA que permite a las máquinas entender, interpretar y generar lenguaje humano. El NLP clínico analiza conversaciones médico-paciente, extrae síntomas, identifica negaciones ("sin dolor torácico"), desambigua términos polisémicos ("frío" como síntoma vs temperatura ambiental) y estructura notas SOAP. El 85% de información clínica está en texto no estructurado; el NLP la convierte en datos procesables.

Modelo de lenguaje grande (Large Language Model, LLM)

Red neuronal entrenada con billones de palabras para predecir la siguiente palabra en una secuencia. GPT-4, Claude 3.5 Sonnet y LLaMA 3 son LLMs generales. Los LLMs médicos (Med-PaLM 2, BioGPT) se entrenan adicionalmente con literatura biomédica, guías clínicas y conversaciones anotadas. Pueden resumir historias clínicas, responder preguntas diagnósticas o generar notas estructuradas a partir de consultas grabadas.

Transformer

Arquitectura de red neuronal que revolucionó el NLP en 2017. A diferencia de modelos recurrentes que procesan palabras secuencialmente, los transformers procesan toda la frase en paralelo mediante mecanismos de "atención" que ponderan la relevancia de cada palabra respecto a las demás. En documentación clínica con IA, los transformers capturan dependencias largas entre síntomas mencionados al inicio de la consulta y tratamientos discutidos al final, superando a las arquitecturas recurrentes previas.

Fine-tuning (ajuste fino)

Reentrenamiento de un LLM preentrenado con un dataset específico de dominio para especializar su comportamiento. Un LLM general se ajusta con 50.000 consultas de pediatría anotadas para aprender terminología pediátrica, estructurar exploraciones según edad y reconocer percentiles de crecimiento. El fine-tuning requiere menos datos y computación que entrenar desde cero.

Named Entity Recognition (NER) médico

Tarea de NLP que identifica y clasifica entidades clínicas en texto: medicamentos (omeprazol 20 mg), enfermedades (EPOC), procedimientos (colonoscopia), anatomía (colon descendente), valores analíticos (hemoglobina 11,2 g/dL). Los sistemas NER médicos entrenan con ontologías como SNOMED-CT o CIE-10 para normalizar variaciones ("infarto", "IAM", "SCA con elevación de ST").

Reconocimiento automático del habla (ASR, Automatic Speech Recognition)

Conversión de audio en texto mediante modelos entrenados con miles de horas de voz anotada. El ASR médico maneja acentos regionales, jerga clínica, nombres de fármacos pronunciados rápidamente y ruido de consulta. Whisper de OpenAI alcanza 95% de precisión en inglés médico; modelos fine-tuned en español clínico superan 92% según benchmarks de 2025.

Inteligencia clínica ambiental (Ambient Clinical Intelligence, ACI)

Sistemas de IA que graban y procesan pasivamente la conversación médico-paciente sin intervención activa del profesional. Detectan automáticamente estructura clínica (anamnesis, exploración, plan), generan notas preliminares en tiempo real y las presentan al médico para revisión. Reducen la carga cognitiva del registro durante la consulta.


Términos de modelos y evaluación

Precisión (Accuracy)

Proporción de predicciones correctas sobre el total. Si un modelo clasifica 100 radiografías y acierta en 92, su precisión es 92%. Métrica útil cuando las clases están balanceadas, pero engañosa con prevalencias bajas: un modelo que siempre predice "no cáncer" en screening tiene 99% de precisión pero es clínicamente inútil.

Sensibilidad (Recall, True Positive Rate)

Proporción de casos positivos reales que el modelo identifica correctamente. Si hay 20 pacientes con sepsis y el modelo detecta 18, sensibilidad = 18/20 = 90%. Alta sensibilidad es crítica en screening oncológico, donde un falso negativo puede ser fatal. Se prioriza en alertas de deterioro clínico.

Especificidad (True Negative Rate)

Proporción de casos negativos reales que el modelo clasifica correctamente como negativos. Si 80 pacientes no tienen neumonía y el modelo acierta en 76, especificidad = 76/80 = 95%. Baja especificidad genera exceso de falsos positivos, saturando al clínico con alertas irrelevantes.

Valor predictivo positivo (VPP, Precision)

Probabilidad de que un paciente clasificado como positivo realmente tenga la enfermedad. Si el modelo alerta sepsis en 25 pacientes y solo 20 la tienen, VPP = 20/25 = 80%. Depende de la prevalencia: con prevalencia baja, incluso modelos de alta sensibilidad y especificidad tienen VPP bajo.

Curva ROC y AUC

La curva ROC (Receiver Operating Characteristic) representa sensibilidad vs (1 − especificidad) para diferentes umbrales de decisión del modelo. El AUC (Area Under the Curve) resume rendimiento en un único valor entre 0,5 (azar) y 1,0 (perfecto). AUC >0,90 se considera excelente en IA médica. La FDA exige AUC >0,85 para dispositivos médicos de IA diagnóstica de alto riesgo.

Sesgo algorítmico (Algorithmic Bias)

Tendencia sistemática del modelo a cometer errores en subgrupos poblacionales específicos. Si un algoritmo de riesgo cardiovascular se entrenó solo con pacientes caucásicos, puede infraestimar riesgo en población afroamericana o asiática. El sesgo nace de datos no representativos o de proxies correlacionados con raza/género que el modelo aprende inadvertidamente.

Overfitting (sobreajuste)

El modelo memoriza ruido y particularidades del dataset de entrenamiento en lugar de aprender patrones generalizables. Rendimiento excelente en datos conocidos pero pobre en pacientes nuevos. Se combate con validación cruzada, regularización y datasets de prueba independientes nunca vistos durante entrenamiento.

Validación externa

Evaluación del modelo en un dataset procedente de una institución, población o periodo temporal diferente al de entrenamiento. Si un algoritmo entrenado en Hospital A funciona bien en Hospital B (diferente prevalencia de comorbilidades, protocolos clínicos, demografía), su robustez aumenta. La validación externa es obligatoria antes de implementación clínica.


IA aplicada a documentación y flujo de trabajo

Transcriptor médico con IA

Software que convierte la conversación clínica grabada en una nota estructurada lista para integrar en la historia clínica electrónica. Combina ASR (audio a texto), NLP clínico (estructuración SOAP, extracción de entidades) y plantillas configurables por especialidad. Según estudios de eficiencia de 2025, reduce el tiempo de documentación 40-60% en atención primaria.

Plantilla clínica configurable

Esquema predefinido que organiza la salida del transcriptor según especialidad y flujo de trabajo local. Una plantilla SOAP estándar divide la nota en Subjetivo, Objetivo, Apreciación y Plan. Una plantilla pediátrica añade percentiles, vacunación, desarrollo psicomotor. El profesional configura qué secciones incluir, qué terminología priorizar y qué nivel de detalle requiere.

SOAP (Subjetivo, Objetivo, Apreciación, Plan)

Estructura de nota clínica universalmente adoptada. Subjetivo: motivo de consulta y síntomas según el paciente. Objetivo: exploración física, constantes, pruebas. Apreciación: diagnóstico o impresión clínica. Plan: tratamiento, seguimiento, derivaciones. Los sistemas de IA estructuran automáticamente la conversación en estas cuatro secciones, ahorrando al médico reorganización manual.

Wake Lock API

Tecnología web que evita que el dispositivo entre en reposo mientras graba. Crítico en transcriptores móviles: si el médico graba una consulta de 20 minutos y la pantalla se apaga a los 2, la grabación se corta. MedicMic implementa Wake Lock nativo en iOS y Android mediante PWA para garantizar continuidad de captura incluso con el móvil en el bolsillo.

Backup automático de audio (IndexedDB)

Almacenamiento local en el navegador que guarda segmentos de audio cada 60 segundos. Si la app se cierra inesperadamente o la conexión falla a mitad de consulta, el sistema recupera los fragmentos guardados al reabrir. Implementación RGPD-compliant: los backups se cifran localmente y se eliminan físicamente tras procesamiento exitoso.


Regulación, ética y privacidad en IA médica

RGPD (Reglamento General de Protección de Datos)

Marco legal europeo que regula el tratamiento de datos personales. El artículo 9 clasifica los datos de salud como "categoría especial" que requiere base legal explícita (consentimiento informado, interés vital, ejercicio de medicina). Los transcriptores de IA en Europa deben cumplir principios de minimización de datos, limitación de finalidad, exactitud, integridad y confidencialidad. Infracciones graves pueden alcanzar multas del 4% de facturación global anual.

HIPAA (Health Insurance Portability and Accountability Act)

Legislación estadounidense que protege la privacidad de información sanitaria identificable (PHI). Los proveedores de IA médica que operan en EEUU deben firmar un Business Associate Agreement (BAA), implementar cifrado en tránsito y reposo, limitar acceso por rol, registrar auditorías completas y permitir al paciente acceso, rectificación y eliminación de sus datos. Sanciones por incumplimiento alcanzan 1,5 M$ por violación.

Consentimiento informado para IA

Autorización específica del paciente para que su consulta sea grabada y procesada por sistemas de IA. Debe explicar: qué se graba, quién procesa el audio, dónde se almacenan datos, cuánto tiempo se conservan, si se comparten con terceros, derecho a revocar. El consentimiento genérico de tratamiento no cubre IA; se requiere disclosure explícito según jurisprudencia GDPR de 2024.

Anonimización vs pseudonimización

Anonimización: eliminación irreversible de identificadores (nombre, DNI, NUHSA) de modo que reidentificar al individuo sea técnicamente imposible. Los datos anonimizados salen del ámbito RGPD. Pseudonimización: sustitución de identificadores por códigos; la reidentificación es posible con tabla de correspondencia bajo control separado. Los datos pseudonimizados siguen siendo personales y requieren salvaguardas RGPD.

Dispositivo médico de IA (certificación CE/FDA)

Software que diagnostica, previene o trata enfermedades. El reglamento MDR europeo y la FDA estadounidense exigen validación clínica, gestión de riesgo según ISO 14971, sistema de calidad ISO 13485 y vigilancia post-comercialización. Los transcriptores de IA que solo documentan (sin diagnóstico automatizado) no se clasifican como dispositivo médico clase IIa-III, pero sistemas de detección de sepsis o interpretación de ECG sí lo son.

Explicabilidad (Explainability, XAI)

Capacidad de un sistema de IA para comunicar en lenguaje comprensible por qué tomó una decisión. Un algoritmo de riesgo cardíaco debe mostrar: "Riesgo alto debido a: edad 68 años (+15 puntos), HTA no controlada (+22), tabaquismo activo (+18)". La explicabilidad aumenta confianza clínica, facilita auditoría y es requisito legal en Europa (artículo 22 RGPD: derecho a explicación sobre decisiones automatizadas).


Preguntas frecuentes

¿Qué diferencia hay entre IA, machine learning y deep learning en medicina?

La IA es el campo general que engloba sistemas capaces de realizar tareas cognitivas; el machine learning es una subcategoría donde los algoritmos aprenden patrones de datos sin programación explícita; y el deep learning es un tipo específico de ML basado en redes neuronales multicapa.

En la práctica clínica, el deep learning impulsa aplicaciones avanzadas como interpretación radiológica o procesamiento de lenguaje natural, mientras que el ML clásico abarca desde regresiones logísticas hasta árboles de decisión para predicción de riesgo.

¿Cómo funciona un transcriptor médico con IA en la consulta?

El transcriptor graba la conversación médico-paciente mediante el micrófono del dispositivo, convierte el audio en texto usando reconocimiento automático del habla (ASR) entrenado con terminología clínica, aplica procesamiento del lenguaje natural (NLP) para identificar síntomas, exploraciones y diagnósticos, y estructura automáticamente la información en formato SOAP o plantilla configurable.

El médico revisa, edita si es necesario y aprueba la nota antes de integrarla en la historia clínica electrónica, reduciendo el tiempo de documentación entre un 40-60%.

¿Qué métricas de evaluación son más importantes para modelos de IA diagnóstica?

La sensibilidad (capacidad de detectar verdaderos positivos) es crítica en screening y detección temprana donde perder un caso puede ser fatal; la especificidad (evitar falsos positivos) es esencial para no saturar con alertas irrelevantes; el valor predictivo positivo refleja cuántos casos alertados son realmente positivos, dependiendo de prevalencia; y el AUC de la curva ROC resume el rendimiento global del modelo.

La métrica prioritaria depende del contexto clínico: alta sensibilidad para cáncer de mama, alta especificidad para alertas de sepsis.

¿Es obligatorio obtener consentimiento específico para usar IA en consulta?

Sí, según el RGPD europeo y jurisprudencia de 2024, el consentimiento informado general de tratamiento no cubre el uso de sistemas de IA que graben o procesen conversaciones clínicas. Debe informarse explícitamente al paciente sobre qué datos se capturan, quién los procesa, dónde se almacenan, durante cuánto tiempo, si se comparten con terceros y su derecho a revocar en cualquier momento. El consentimiento debe ser específico, informado, libre e inequívoco antes de activar la grabación.

¿Qué diferencia un modelo con sesgo algorítmico de uno equitativo en medicina?

Un modelo sesgado comete errores sistemáticos en subgrupos poblacionales específicos debido a datos de entrenamiento no representativos o proxies inadvertidos correlacionados con variables sensibles como raza o género. Un modelo equitativo mantiene rendimiento comparable (sensibilidad, especificidad, VPP) entre diferentes grupos demográficos, etnias, géneros y condiciones socioeconómicas. La detección de sesgo requiere validación estratificada por subgrupos; la corrección implica datasets balanceados, eliminación de proxies injustos y auditorías continuas post-implementación según recomendaciones de la OMS y FDA.

¿Los transcriptores de IA requieren certificación como dispositivo médico?

Los transcriptores que solo documentan la conversación clínica sin realizar diagnóstico, tomar decisiones terapéuticas automatizadas o calcular riesgos clínicos no se clasifican como dispositivo médico según el MDR europeo ni la FDA estadounidense, por lo que no requieren marcado CE médico ni aprobación 510(k). Sin embargo, deben cumplir RGPD/HIPAA para protección de datos sanitarios, implementar cifrado, auditorías y consentimiento informado.

Si el sistema incorpora funciones diagnósticas o recomendaciones terapéuticas automatizadas, entonces sí requiere certificación como dispositivo médico clase IIa o superior.

¿Cómo garantizar que un modelo de IA médico no sufre overfitting?

El overfitting se previene separando los datos en conjuntos de entrenamiento, validación y prueba completamente independientes; aplicando técnicas de regularización (L1, L2, dropout) que penalizan complejidad excesiva; usando validación cruzada para evaluar robustez en diferentes subconjuntos; y realizando validación externa en poblaciones de instituciones, periodos temporales y geografías distintas.

Un modelo con rendimiento excelente en datos de entrenamiento pero pobre en validación externa probablemente ha memorizado ruido específico y no generalizará bien en práctica clínica real.