13 分钟min read
순한글 한국어를 국한혼용으로 되돌리기: 변환기 제작 기록
작년의 중의성 해소 모델 설계안을 이번에는 실제로 돌아가는 변환기로 만들었다. 1920–1962년 국한혼용 신문을 학습 데이터로 쓰고 XLM-R로 후보를 채점해, 보류 집합에서 종단간 F1 0.806, 한자 오선택 2.4%. 단계별 수치와 겪은 문제를 적는다.
3 篇
작년의 중의성 해소 모델 설계안을 이번에는 실제로 돌아가는 변환기로 만들었다. 1920–1962년 국한혼용 신문을 학습 데이터로 쓰고 XLM-R로 후보를 채점해, 보류 집합에서 종단간 F1 0.806, 한자 오선택 2.4%. 단계별 수치와 겪은 문제를 적는다.
昨年의 中義性 解消 모델 設計案을 이번에는 實際로 돌아가는 變換器로 만들었다. 1920–1962年 國漢混用 新聞을 學習 데이터로 쓰고 XLM-R로 候補를 採點해, 保留 集合에서 終端間 F1 0.806, 漢字 誤選擇 2.4%. 段階別 數値와 겪은 問題를 적는다.
한국어에는 한글 표기가 같지만 대응하는 한자와 뜻이 다른 한자어가 많다. 문맥으로 올바른 한자 의미를 판별하는 모델의 설계.