10 分钟min read
把纯谚文韩语转回国汉混用:一个转换器的制作记录
去年那篇消歧模型的设计稿,这次做成了能跑的东西。用 1920–1962 年的混用报纸当训练数据,XLM-R 打分,在留出集上端到端 F1 0.806,选错汉字的比例 2.4%。附每一步的数字和踩过的坑。
5 篇
去年那篇消歧模型的设计稿,这次做成了能跑的东西。用 1920–1962 年的混用报纸当训练数据,XLM-R 打分,在留出集上端到端 F1 0.806,选错汉字的比例 2.4%。附每一步的数字和踩过的坑。
작년의 중의성 해소 모델 설계안을 이번에는 실제로 돌아가는 변환기로 만들었다. 1920–1962년 국한혼용 신문을 학습 데이터로 쓰고 XLM-R로 후보를 채점해, 보류 집합에서 종단간 F1 0.806, 한자 오선택 2.4%. 단계별 수치와 겪은 문제를 적는다.
昨年의 中義性 解消 모델 設計案을 이번에는 實際로 돌아가는 變換器로 만들었다. 1920–1962年 國漢混用 新聞을 學習 데이터로 쓰고 XLM-R로 候補를 採點해, 保留 集合에서 終端間 F1 0.806, 漢字 誤選擇 2.4%. 段階別 數値와 겪은 問題를 적는다.
目标是让 33B 的视频生成模型在 112 张 V100 上产出 30 秒成片。为此要先修共享存储、统一 GPU 基线、自建调度器、把节点从 K3s 手里接过来。含每一次失败的根因。
从 15 台机器的实际状态出发,记录自建软件包、MariaDB 选型、InnoDB 与 ZFS 参数的依据,以及控制面与计算节点的通信路径。