10 分钟min read
实时韩语字幕的汉谚混写:Whisper turbo 与后文纠错
把已有的 Hanja 消歧模型接到麦克风和浏览器标签页音频。记录增量上下文、候选重排、字幕回改协议,以及 32 段 FLEURS 音频上没有带来 CER 改善的 N-best 联合打分实验。
4 篇
把已有的 Hanja 消歧模型接到麦克风和浏览器标签页音频。记录增量上下文、候选重排、字幕回改协议,以及 32 段 FLEURS 音频上没有带来 CER 改善的 N-best 联合打分实验。
去年那篇消歧模型的设计稿,这次做成了能跑的东西。用 1920–1962 年的混用报纸当训练数据,XLM-R 打分,在留出集上端到端 F1 0.806,选错汉字的比例 2.4%。附每一步的数字和踩过的坑。
安裝 Google sentencepiece、安裝依賴、安裝並運行
韩语中存在大量同形同音的汉字词(即韩语谚文表记相同但对应不同汉字…