TurkTokenizer, Türkçe ve diğer sondan eklemeli (agglutinative) diller için geliştirilmiş; derin öğrenme tabanlı bağımlılık ayrıştırma (dependency parsing) ile kural tabanlı morfolojik durum makinelerini (FSM) birleştiren açık kaynaklı bir dil işleme projesidir.
Proje, ek yığılmaları ve anlamsal belirsizlikleri (disambiguation) fonksiyonel etiket şemalarıyla çözerek yüksek doğrulukta sözdizimsel ve morfolojik analiz sağlar.
%88.19
UAS Performance
%76.46
LAS Accuracy
%92.34
UPOS Precision
İletişim & Katkı Sağlamak için
Araştırma kredileri, akademik veri seti sentezi veya proje iş birlikleri için doğrudan proje lideriyle iletişime geçebilirsiniz:
E-posta: turktokenizer@cizgiturk.com
Github: https://github.com/ozelturktarkan/TurkTokenizer
Project Lead: Tarkan Özel (Independent NLP Researcher)