10 分钟min read
把纯谚文韩语转回国汉混用:一个转换器的制作记录
去年那篇消歧模型的设计稿,这次做成了能跑的东西。用 1920–1962 年的混用报纸当训练数据,XLM-R 打分,在留出集上端到端 F1 0.806,选错汉字的比例 2.4%。附每一步的数字和踩过的坑。
6 篇
去年那篇消歧模型的设计稿,这次做成了能跑的东西。用 1920–1962 年的混用报纸当训练数据,XLM-R 打分,在留出集上端到端 F1 0.806,选错汉字的比例 2.4%。附每一步的数字和踩过的坑。
작년의 중의성 해소 모델 설계안을 이번에는 실제로 돌아가는 변환기로 만들었다. 1920–1962년 국한혼용 신문을 학습 데이터로 쓰고 XLM-R로 후보를 채점해, 보류 집합에서 종단간 F1 0.806, 한자 오선택 2.4%. 단계별 수치와 겪은 문제를 적는다.
昨年의 中義性 解消 모델 設計案을 이번에는 實際로 돌아가는 變換器로 만들었다. 1920–1962年 國漢混用 新聞을 學習 데이터로 쓰고 XLM-R로 候補를 採點해, 保留 集合에서 終端間 F1 0.806, 漢字 誤選擇 2.4%. 段階別 數値와 겪은 問題를 적는다.
安裝 Google sentencepiece、安裝依賴、安裝並運行
韩语中存在大量同形同音的汉字词(即韩语谚文表记相同但对应不同汉字…
한국어에는 한글 표기가 같지만 대응하는 한자와 뜻이 다른 한자어가 많다. 문맥으로 올바른 한자 의미를 판별하는 모델의 설계.