Chia, a large annotated corpus of clinical trial eligibility criteria.
Journal
Scientific data
ISSN: 2052-4463
Titre abrégé: Sci Data
Pays: England
ID NLM: 101640192
Informations de publication
Date de publication:
27 08 2020
27 08 2020
Historique:
received:
21
02
2020
accepted:
30
07
2020
entrez:
29
8
2020
pubmed:
29
8
2020
medline:
9
1
2021
Statut:
epublish
Résumé
We present Chia, a novel, large annotated corpus of patient eligibility criteria extracted from 1,000 interventional, Phase IV clinical trials registered in ClinicalTrials.gov. This dataset includes 12,409 annotated eligibility criteria, represented by 41,487 distinctive entities of 15 entity types and 25,017 relationships of 12 relationship types. Each criterion is represented as a directed acyclic graph, which can be easily transformed into Boolean logic to form a database query. Chia can serve as a shared benchmark to develop and test future machine learning, rule-based, or hybrid methods for information extraction from free-text clinical trial eligibility criteria.
Identifiants
pubmed: 32855408
doi: 10.1038/s41597-020-00620-0
pii: 10.1038/s41597-020-00620-0
pmc: PMC7452886
doi:
Types de publication
Dataset
Journal Article
Research Support, N.I.H., Extramural
Langues
eng
Sous-ensembles de citation
IM
Pagination
281Subventions
Organisme : NLM NIH HHS
ID : R01 LM009886
Pays : United States
Organisme : NHLBI NIH HHS
ID : T35 HL007616
Pays : United States
Organisme : NCATS NIH HHS
ID : UL1 TR001873
Pays : United States
Références
Weng, C. Optimizing Clinical Research Participant Selection with Informatics. Trends in pharmacological sciences 36, 706–709, https://doi.org/10.1016/j.tips.2015.08.007 (2015).
doi: 10.1016/j.tips.2015.08.007
pubmed: 26549161
pmcid: 4686428
Banda, J. M., Seneviratne, M., Hernandez-Boussard, T. & Shah, N. H. Advances in Electronic Phenotyping: From Rule-Based Definitions to Machine Learning Models. Annual review of biomedical data science 1, 53–68, https://doi.org/10.1146/annurev-biodatasci-080917-013315 (2018).
doi: 10.1146/annurev-biodatasci-080917-013315
pubmed: 31218278
pmcid: 6583807
Sen, A. et al. Correlating eligibility criteria generalizability and adverse events using Big Data for patients and clinical trials. Ann N Y Acad Sci 1387, 34–43, https://doi.org/10.1111/nyas.13195 (2017).
doi: 10.1111/nyas.13195
pubmed: 27598694
Murthy, V. H., Krumholz, H. M. & Gross, C. P. Participation in cancer clinical trials: race-, sex-, and age-based disparities. Jama 291, 2720–2726, https://doi.org/10.1001/jama.291.22.2720 (2004).
doi: 10.1001/jama.291.22.2720
pubmed: 15187053
Chondrogiannis, E. et al. A novel semantic representation for eligibility criteria in clinical trials. Journal of biomedical informatics 69, 10–23, https://doi.org/10.1016/j.jbi.2017.03.013 (2017).
doi: 10.1016/j.jbi.2017.03.013
pubmed: 28336477
Williams, R. J., Tse, T., DiPiazza, K. & Zarin, D. A. Terminated Trials in the ClinicalTrials.gov Results Database: Evaluation of Availability of Primary Outcome Data and Reasons for Termination. PloS one 10, e0127242, https://doi.org/10.1371/journal.pone.0127242 (2015).
doi: 10.1371/journal.pone.0127242
pubmed: 26011295
pmcid: 4444136
Richesson, R. L. et al. Electronic health records based phenotyping in next-generation clinical trials: a perspective from the NIH Health Care Systems Collaboratory. J Am Med Inform Assoc 20, e226–e231, https://doi.org/10.1136/amiajnl-2013-001926 (2013).
doi: 10.1136/amiajnl-2013-001926
pubmed: 23956018
pmcid: 3861929
Weng, C. Optimizing Clinical Research Participant Selection with Informatics. Trends Pharmacol Sci 36, 706–709, https://doi.org/10.1016/j.tips.2015.08.007 (2015).
doi: 10.1016/j.tips.2015.08.007
pubmed: 26549161
pmcid: 4686428
Weng, C., Tu, S. W., Sim, I. & Richesson, R. Formal representation of eligibility criteria: a literature review. Journal of biomedical informatics 43, 451–467, https://doi.org/10.1016/j.jbi.2009.12.004 (2010).
doi: 10.1016/j.jbi.2009.12.004
pubmed: 20034594
Patel, P., Davey, D., Panchal, V. & Pathak, P. Annotation of a Large Clinical Entity Corpus. (2018).
Mohan, S. & Li, D. MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts. (2019).
Weng, C. et al. EliXR: an approach to eligibility criteria extraction and representation. Journal of the American Medical Informatics Association 18, i116–i124, https://doi.org/10.1136/amiajnl-2011-000321 (2011).
doi: 10.1136/amiajnl-2011-000321
pubmed: 21807647
pmcid: 3241167
Ross, J., Tu, S., Carini, S. & Sim, I. Analysis of eligibility criteria complexity in clinical trials. Summit Transl Bioinform, 46–50 (2010).
Kang, T. et al. EliIE: An open-source information extraction system for clinical trial eligibility criteria. J Am Med Inform Assoc 24, 1062–1071, https://doi.org/10.1093/jamia/ocx019 (2017).
doi: 10.1093/jamia/ocx019
pubmed: 28379377
pmcid: 6259668
Tu, S. W. et al. A practical method for transforming free-text eligibility criteria into computable criteria. Journal of biomedical informatics 44, 239–250, https://doi.org/10.1016/j.jbi.2010.09.007 (2011).
doi: 10.1016/j.jbi.2010.09.007
pubmed: 20851207
Zhang, H. et al. Computable Eligibility Criteria through Ontology-driven Data Access: A Case Study of Hepatitis C Virus Trials. AMIA Annu Symp Proc, 1601–1610 (2018).
Milian, K. et al. Enhancing reuse of structured eligibility criteria and supporting their relaxation. Journal of biomedical informatics 56, 205–219, https://doi.org/10.1016/j.jbi.2015.05.005 (2015).
doi: 10.1016/j.jbi.2015.05.005
pubmed: 26015310
Lonsdale, D., Tustison, C., Parker, C. & Embley, D. Formulating Queries for Assessing Clinical Trial Eligibility. (2006).
Reich, C., Ryan, P. B., Belenkaya, R., Natarajan, K. & Blacketer, C. OHDSI Common Data Model v6.0 Specifications, https://github.com/OHDSI/CommonDataModel/wiki (2019).
Zarin, D. A., Fain, K. M., Dobbins, H. D., Tse, T. & Williams, R. J. 10-Year Update on Study Results Submitted to ClinicalTrials.gov. New England Journal of Medicine 381, 1966–1974, https://doi.org/10.1056/NEJMsr1907644 (2019).
doi: 10.1056/NEJMsr1907644
pubmed: 31722160
Suvarna, V. Phase IV of Drug Development. Perspect Clin Res 1, 57–60 (2010).
pubmed: 21829783
pmcid: 3148611
Stenetorp, P. et al. brat: a Web-based Tool for NLP-Assisted Text Annotation. Proceedings of the Demonstrations at the 13th Conference of the European Chapter of the Association for Computational Linguistics, 102–107 (2012).
Clinical Trials Transformation Initiative. Aggregate Analysis of ClinicalTrials.gov, https://aact.ctti-clinicaltrials.org/ (2016).
Kury, F. S. P. et al. Chia Annotated Datasets. figshare https://doi.org/10.6084/m9.figshare.11855817.v2 (2020).
Sang, E. F. & De Meulder, F. Introduction to the CoNLL-2003 shared task: Language-independent named entity recognition. arXiv preprint cs/0306050 (2003).
Observational Health Data Sciences and Informatics. Usagi, https://www.ohdsi.org/web/wiki/doku.php?id=documentation:software:usagi (2018).
Luo, Z., Johnson, S. B., Lai, A. M. & Weng, C. Extracting temporal constraints from clinical research eligibility criteria using conditional random fields. AMIA Annu Symp Proc, 843–852 (2011).
Chuan, C.-H. Classifying Eligibility Criteria in Clinical Trials Using Active Deep Learning. (2018).
Luo, Z., Johnson, S. B. & Weng, C. Semi-Automatically Inducing Semantic Classes of Clinical Research Eligibility Criteria Using UMLS and Hierarchical Clustering. AMIA Annu Symp Proc, 487–491 (2010).
Sun, Y. & Loparo, K. In 2019 IEEE 43rd Annual Computer Software and Applications Conference (COMPSAC). 954–955.
Sun, Y. & Loparo, K. Knowledge-guided Text Structuring in Clinical Trials. (2019).
Yuan, C. et al. Criteria2Query: a natural language interface to clinical databases for cohort definition. J Am Med Inform Assoc 26, 294–305, https://doi.org/10.1093/jamia/ocy178 (2019).
doi: 10.1093/jamia/ocy178
pubmed: 30753493
pmcid: 6402359
Alex, B., Haddow, B. & Grover, C. Recognising nested named entities in biomedical text. (Association for Computational Linguistics, 2007).
Yuan, C. et al. A Graph-Based Method for Reconstructing Entities from Coordination Ellipsis in Medical Text. Journal of the American Medical Informatics Association (2020).
Doğan, R. I., Leaman, R. & Lu, Z. NCBI disease corpus: a resource for disease name recognition and concept normalization. Journal of biomedical informatics 47, 1–10, https://doi.org/10.1016/j.jbi.2013.12.006 (2014).
doi: 10.1016/j.jbi.2013.12.006
pubmed: 24393765
pmcid: 3951655
Kim, J. D., Ohta, T., Tateisi, Y. & Tsujii, J. GENIA corpus–semantically annotated corpus for bio-textmining. Bioinformatics 19(Suppl 1), i180–182, https://doi.org/10.1093/bioinformatics/btg1023 (2003).
doi: 10.1093/bioinformatics/btg1023
pubmed: 12855455
Banda, J. M., Halpern, Y., Sontag, D. & Shah, N. H. Electronic phenotyping with APHRODITE and the Observational Health Sciences and Informatics (OHDSI) data network. AMIA Jt Summits Transl Sci Proc, 48–57 (2017).