Descripción y aportación
El proyecto DRUGS4COVID++ supuso mi avance más significativo en el procesamiento automático de texto clínico y biomédico. El trabajo abordó de forma sistemática las particularidades del lenguaje clínico, caracterizado por una elevada heterogeneidad terminológica y semántica. Uno de los principales desafíos fue la normalización terminológica de medicamentos, síntomas y enfermedades, cuyas denominaciones varían según el país, la marca o el contexto, así como el enlace semántico de experimentos y evidencias clínicas dispersas en distintas publicaciones científicas. Mi contribución se centró en el diseño de técnicas de procesamiento del lenguaje natural para la extracción, normalización y enlace de entidades clínicas, así como en la estructuración de la información extraída en grafos de conocimiento explotables mediante sistemas de consulta y question answering. Como resultado directo del proyecto se derivaron varias publicaciones científicas relevantes, entre ellas el artículo en Journal of Biomedical Informatics sobre extracción de conocimiento clínico, el trabajo MuHeQA en Semantic Web sobre question answering sobre grafos heterogéneos, y EBOCA, donde se desarrolló una ontología para representar evidencias clínicas extraídas de literatura científica. Asimismo, el proyecto dio lugar al desarrollo de la plataforma Drugs4Covid (https://drugs4covid.oeg.fi.upm.es/ ), que permite explorar literatura científica sobre COVID-19 mediante lenguaje natural.