Un único implante ha permitido decodificar de forma simultánea el habla y los gestos de personas con parálisis, y reproducirlos en un avatar virtual de cuerpo entero. El avance, descrito en la revista Nature Neuroscience, busca devolver matices expresivos a pacientes que han perdido movilidad del cuerpo y del tracto vocal.
El estudio se realizó con tres participantes que presentan parálisis severa. En todos ellos se instalaron electrodos de electrocorticografía (ECoG) de alta densidad sobre la corteza sensoriomotora para capturar señales vinculadas tanto a movimientos de extremidades como a gestos faciales y bucofonatorios asociados al habla. Los investigadores detectaron que los patrones neuronales cambian cuando la persona intenta ejecutar acciones de forma concurrente, lo que complicaba la decodificación si los modelos se entrenaban solo con acciones aisladas.
Para superar ese reto los equipos aplicaron un entrenamiento cruzado que combinó datos de movimientos y de habla realizados de forma aislada y simultánea. Con esos modelos calibrados, dos de los participantes probaron en tiempo real la animación de un avatar que integraba palabras y gestos. Los resultados fueron muy elevados: en tareas de conversación y gestualidad el sistema identificó ambos tipos de señales con alta precisión y, en un caso, un participante alcanzó una precisión del 100% en la traducción de palabras y gestos a lo largo de tres bloques conversacionales. Además, el modelo interpretó correctamente emparejamientos de frases y movimientos que no habían sido presentados juntos durante el entrenamiento.
Los autores advierten que la tecnología permanece en fase experimental: el repertorio probado es limitado en vocabulario y gestos, y el número de participantes es reducido. Edward Chang, investigador principal del estudio en UCSF, subraya la necesidad de ensayos más amplios antes de una aplicación clínica. El trabajo abre una vía para interfaces que ofrezcan comunicación más natural y expresiva a personas con parálisis, y plantea nuevos desafíos en el desarrollo de modelos de inteligencia artificial capaces de integrar señales múltiples en tiempo real.




