Towards Language-Aware Pharmaceutical Informatics: End-to-End ATC Code Classification from Regulatory Documents
IEEE Access, 2026 (SCI-Expanded, Scopus)
- Yayın Türü: Makale / Tam Makale
- Basım Tarihi: 2026
- Doi Numarası: 10.1109/access.2026.3711902
- Dergi Adı: IEEE Access
- Derginin Tarandığı İndeksler: Science Citation Index Expanded (SCI-EXPANDED), Scopus, Compendex, INSPEC, Directory of Open Access Journals
- Anahtar Kelimeler: ATC classification, BERT, drug classification, hyperparameter optimization, Turkish medical drug dataset
- Galatasaray Üniversitesi Adresli: Evet
Özet
Accurate classification of Anatomical Therapeutic Chemical (ATC) codes from pharmaceutical documents remains a challenging task, particularly in low resource linguistic contexts. This study introduces a newly curated dataset of drug manuals encompassing all ATC categories to support research in pharmaceutical informatics. This paper proposes a Natural Language Processing (NLP)-based framework for end-to-end ATC code classification, addressing key challenges such as contextual ambiguity and limited labeled data availability. Leveraging NLP methodologies, the datasetwas used to train and evaluate various text classification models, including Support Vector Classifier (SVC), FastText, and transformer-based architectures such as BERTurk Uncased, BERTurk Large, ConvBERTurk, ElectroBERTurk, and DistilBERTurk. Extensive preprocessing and model optimization led to significant improvements in classification performance, with FastText achieving an F1-score of 96.0%, BERTurk Uncased reaching 95.9%, and SVC attaining 94.0%. These results validate the usefulness and effectiveness of the proposed dataset, establishing a benchmark for future ATC code classification research in pharmaceutical text analytics.