¿Puede una IA detectar el estrés por la voz y la cara? Qué muestra un estudio con sanitarios
Un estudio con 553 sanitarios combinó lenguaje, voz y rostro para detectar perfiles de estrés. Es un primer paso, no una herramienta clínica.
Redactado por Equipo MentivaPublicado el 7 min de lectura

Respuesta directa
Un equipo de la Universidad de Nueva York (NYU) y SRI International entrenó una IA que analiza lo que cuenta una persona, cómo suena su voz y su expresión facial en vídeos cortos. Con ello distinguió, con un acierto moderado (un AUROC de 0,75, donde 0,5 sería el azar y 1 la perfección), a los sanitarios con un perfil de estrés «vulnerable» de los «resilientes» durante seis semanas. Combinar las tres señales funcionó mejor que usar solo el lenguaje. Es una prueba de concepto en un grupo concreto: no diagnostica nada ni está lista para usarse con pacientes.
Qué dice el estudio
Qué se ha publicado
El 2 de octubre de 2026, la revista npj Digital Medicine publicó, en acceso abierto (gratuito para todos), un estudio de investigadores de la Facultad de Medicina Grossman de la Universidad de Nueva York (NYU) y de SRI International. Es una versión aceptada que se ha difundido de forma anticipada: la propia revista avisa de que puede cambiar antes de la versión definitiva.
Según la declaración de los autores, lo financiaron DARPA (la agencia de investigación de defensa de EE. UU.) y los Institutos Nacionales de Salud. Los financiadores no intervinieron en el diseño, el análisis ni la redacción.
Qué hicieron los investigadores
- Siguieron durante seis semanas a profesionales sanitarios: invitaron a 750 y 553 aportaron datos suficientes.
- Cada semana, esas personas grabaron relatos cortos sobre situaciones recientes que les habían estresado. También rellenaron cuestionarios sobre ansiedad, depresión, agotamiento (burnout) y malestar.
- Con las respuestas a los cuestionarios, un análisis estadístico las agrupó en dos perfiles según cómo evolucionaban sus puntuaciones: «resiliente» (295 personas) y «vulnerable» (258).
- De las grabaciones sacaron datos numéricos de lo que se dice (el lenguaje), cómo se dice (la voz) y la expresión de la cara. Un modelo de IA «multimodal», que combina distintos tipos de señales, los usó para intentar adivinar a qué perfil pertenecía cada persona.
- Probaron el modelo con un grupo de datos que se había dejado aparte y que no había visto mientras aprendía.
Qué encontraron
- Con las tres señales a la vez, el modelo logró un AUROC de 0,75. Es una forma de medir cuánto sirve un modelo para separar dos grupos: 0,5 equivale a lanzar una moneda y 1, a acertar siempre.
- Solo con el lenguaje, el resultado fue de 0,63. Con lenguaje y voz, de 0,70. Sumar señales mejoró el resultado.
- Los autores lo describen como una prueba de concepto, es decir, una primera demostración de que la idea puede funcionar. Creen que estas herramientas podrían complementar los métodos de evaluación habituales.
- Su punto de partida es que los cuestionarios tienen límites: el estigma profesional hace que, a veces, la gente no cuente lo que le pasa.
Qué significa realmente
En este grupo de profesionales sanitarios, lo que alguien cuenta, cómo suena y cómo se expresa en un vídeo corto contiene información que se relaciona con el perfil de estrés que mostraba durante seis semanas.
Un AUROC de 0,75 es un acierto moderado: mucho mejor que el azar, pero no separa los dos perfiles de forma perfecta.
Es un resultado prometedor para la investigación, no una herramienta validada para la consulta. Entre un modelo que funciona en un estudio y una aplicación que se pueda usar con seguridad con pacientes suele haber un camino largo: repetir el estudio, probarlo en otros grupos y evaluar los riesgos.
Qué NO demuestra
- Que sea un diagnóstico. El modelo no establece diagnósticos: distingue dos perfiles definidos con cuestionarios sobre ansiedad, depresión, burnout y malestar.
- Que una IA pueda «leer» el estrés en la cara o la voz de cualquier persona. El resumen tampoco detalla cuánto aporta cada señal por separado más allá de las combinaciones citadas.
- Que sea una tecnología lista para usar con pacientes. Nada en el resumen indica que lo esté.
- Que se pueda aplicar sin más a toda la población. Los participantes son profesionales sanitarios que aceptaron participar.
- Que sustituya el criterio de un profesional. Los autores hablan de complementar la evaluación habitual, no de reemplazarla.
Limitaciones a tener en cuenta
- Qué hemos podido leer. La página pública de la revista ofrece el resumen y los datos de publicación; no hemos podido leer el texto completo. Por eso no podemos comentar detalles como el tamaño del grupo de prueba ni el apartado de limitaciones que escriben los autores.
- Un grupo concreto. No sabemos si funcionaría igual con otras profesiones, edades, idiomas o culturas.
- Etiquetas basadas en cuestionarios. El modelo aprende a reproducir perfiles construidos con lo que la gente cuenta sobre sí misma, y eso también tiene sus sesgos.
- La cara no es un termómetro de las emociones. Una revisión de referencia sobre la expresión facial (Barrett y colaboradores, 2019) concluye que la forma de expresar emociones cambia según la cultura, la situación e incluso la persona, y que un mismo gesto puede significar cosas distintas. Es una advertencia general sobre este campo, no una crítica específica a este estudio.
- Privacidad. Analizar la voz y el rostro plantea preguntas, como quién accede a esos datos y para qué se usan. El resumen no las aborda. Es una reflexión nuestra, no un hallazgo del estudio.
Qué puede significar para una persona
- No necesitas que una IA confirme tu estrés. Este estudio no ofrece una herramienta de IA lista para que cualquiera mida el suyo. Lo que sientes ya es información suficiente para cuidarte o pedir ayuda.
- Pedir ayuda no es un fallo profesional. El propio estudio señala que el estigma profesional y la tendencia a no contar el malestar limitan los cuestionarios habituales. Es una reflexión nuestra: puede pasarle a cualquier persona con un trabajo muy exigente.
- Mira la evolución, no solo un mal día. El estudio sigue a las personas durante semanas porque el estrés es un proceso. Fijarte en cómo duermes, cómo empiezas la semana o cuánto te cuesta desconectar puede ayudarte a distinguir una racha dura de un desgaste que se alarga. No es el método del estudio, pero va en la misma línea.
Cuándo puede ser razonable hablar con un profesional
Si el estrés se mantiene durante semanas, si notas un cansancio que el descanso no arregla, irritabilidad, dificultad para desconectar, problemas de sueño o la sensación de que ya no das abasto, puede ser un buen momento para hablarlo con un profesional. No hace falta esperar a no poder más.
Preguntas frecuentes
¿Puede una IA detectar el estrés solo por la voz?
El resumen del estudio no da el resultado de la voz por sí sola. Lo que sí cuenta es que el lenguaje solo logró un 0,63, el lenguaje con la voz un 0,70 y las tres señales juntas (lenguaje, voz y cara) un 0,75. No podemos decir cuánto aporta la voz de forma aislada.
¿Puede diagnosticar estrés?
No. El modelo no diagnostica nada: separa a las personas en dos perfiles definidos con cuestionarios («resiliente» y «vulnerable»). Si lo que quieres es entender qué te pasa, puedes empezar por conocer las señales del estrés.
¿Qué señales analizó la investigación?
Tres: el lenguaje (lo que la persona cuenta), la voz (cómo suena) y la expresión facial. Las sacó de relatos cortos grabados cada semana durante seis semanas.
¿Los resultados se pueden aplicar a cualquier persona?
No se sabe. El estudio se hizo con 553 profesionales sanitarios y no se sabe si funcionaría igual con otras profesiones, edades o culturas. Hace falta repetirlo en otros grupos.
¿Esta tecnología se utiliza ya en terapia?
El resumen no informa de ningún uso clínico. Los autores lo presentan como una prueba de concepto: un primer paso de investigación, no una herramienta lista para usarse en consulta.
¿La cara revela cómo nos sentimos?
No de forma fiable. Una revisión de referencia concluye que cómo se expresan las emociones varía según la cultura, la situación y la persona, y que un mismo gesto puede querer decir cosas distintas. Por eso hay que tomar con cautela cualquier sistema que pretenda deducir emociones de los gestos.
Contenido relacionado en Mentiva
Áreas de trabajo
Síntomas relacionados
Quizá ahora te ayude seguir con una de estas preguntas
Fuentes y evidencia
Este artículo es contenido original de Mentiva. Estas son las fuentes en las que se apoya; te recomendamos leer la principal directamente.
Fuente principal
Multimodal computational analysis of longitudinal stress profiles in healthcare workers
Estudio original · npj Digital Medicine (Nature Portfolio) · 2 de octubre de 2026
nature.com · DOI 10.1038/s41746-026-03328-4 · Consultada el 6 de octubre de 2026
Hemos leído el resumen, los datos de publicación y la declaración de financiación de la página de la revista. Es una versión aceptada publicada de forma anticipada: no hemos podido leer el texto completo y puede cambiar antes de la versión definitiva.
Evidencia complementaria y contexto
- Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements (se abre en una pestaña nueva)
Revisión científica · Psychological Science in the Public Interest · julio de 2019
pubmed.ncbi.nlm.nih.gov · DOI 10.1177/1529100619832930 · Consultada el 6 de octubre de 2026
Hemos leído el resumen publicado en PubMed.
¿Quieres hablarlo con alguien?
Si lo que has leído te suena, puedes empezar por una orientación de bienestar: unas pocas preguntas para ver qué áreas te gustaría explorar. Y si prefieres hablar con un psicólogo, te ayudamos a encontrar a un profesional que encaje contigo; la llamada de orientación previa es gratuita y sin compromiso.


