TurkTokenizer

Open-Source Turkish NLP Initiative

TurkTokenizer, Türkçe ve diğer sondan eklemeli (agglutinative) diller için geliştirilmiş; derin öğrenme tabanlı bağımlılık ayrıştırma (dependency parsing) ile kural tabanlı morfolojik durum makinelerini (FSM) birleştiren açık kaynaklı bir dil işleme projesidir.

Proje, ek yığılmaları ve anlamsal belirsizlikleri (disambiguation) fonksiyonel etiket şemalarıyla çözerek yüksek doğrulukta sözdizimsel ve morfolojik analiz sağlar.

%88.19

UAS Performance

%76.46

LAS Accuracy

%92.34

UPOS Precision

İletişim & Katkı Sağlamak için

Araştırma kredileri, akademik veri seti sentezi veya proje iş birlikleri için doğrudan proje lideriyle iletişime geçebilirsiniz:

E-posta: turktokenizer@cizgiturk.com

Github: https://github.com/ozelturktarkan/TurkTokenizer

Project Lead: Tarkan Özel (Independent NLP Researcher)