摘要:上海财经媒体用3.2万篇报道训练垂直文本模型,事实核查准确率超通用大模型11个百分点。编辑参与标注,小模型加高质量语料或成新闻业新方向。
上周小数据亚星APP代理登陆。上海一家财经媒体手艺团队公布了一项AI文章文本模子锻炼的阶段性功效,用3.2万篇深度报导、经由四轮人工清洗后锻炼出的垂曲模子,文章文本正在事实核对任务上比通用年夜模子精确率逾越跨越11个百分点了。团队负责人李默正在内部简报里写了一句,“堆参数不如洗数据”那句话正在编辑部传开了。他们的做法不复纯模锻。先把十年来的见报稿和已刊稿全数拆成段落,剔除告白、重复句和记者手记。八名编辑花三周标注了8000个句子,专门标识表记标帜“同比”“环比”“归母净利润”那类财经术语炼转料库。锻炼早期了。模子老把“同比降落”写成“环比降落”。

加入划定规矩约束才纠正。李默说,AI文章文本模子锻炼最用背财的时间的就是让机械理解新闻里的时间逻辑。我翻过他们的经媒建语锻炼日志。有一页记载着某次失败。模子把“部门地域有雨”生成成“部门有雨”,编辑们笑了半天。

那种毛病正在通用语料里几乎不会隐现吧,体自新闻文本的松散性要求每个词都有出处。另一家都邑报检讨考试用AI写气候简讯了。功效把“台风预警”写成“台风预告”,被气象局打电话提醉。数据量量差一个品级,输出就差一个世界的。
如今,那家财经媒体的编辑们每周要加入两小时标注会。一位从业15年的老编辑说,以前改稿子的。如今改模子。他的工位上揭着一张便签。“别让模子教会你的坏弊端”手艺团队正计划把模子开源。
更多地方媒体用低本钱完成AI文章文本模子锻炼了。小模子加高量量语料,或许比千亿参数更切近新闻编辑室的实正在需求。
版权声明:除特别声明外,本站所有文章皆是来自互联网,转载请以超链接形式注明出处!




