第43章 一二十层楼那么高(2/2)

投票推荐 加入书签 留言反馈

【畅读更新加载慢,有广告,章节不完整,请退出畅读后阅读!】

br />

    他把文件分块下载,然后打开查看,这才发现这些资料压根不能直接用于训练。



    网页里充斥着导航栏,广告,版权声明,推荐链接之类的内容。



    另外一篇文章可能被不同的网站转载几十上百次,标题只是稍作修改,内容几乎完全一致,百家号的泛滥导致去重工作是天量。



    论坛帖子则有大量无意义的回复。



    千禧年的回复,“我顶”、“沙发”、“路过”、“露珠好人”。



    再加上中文文本本身的复杂度。



    简体繁体异体字混杂,全角半角符号不统一,网页编码错误会把一段正常文字变成乱码。



    火星文就不说了。



    有些内容看上去是中文,实际上是机器翻译的语句,语法正确,表达方式却格外怪异。



    种种问题堆叠在一起,赵元任找不到切入点。



    这就好像已经被猫打乱的毛球,所有的线头混在一起,你压根找不到最初的那根线头。



    晚上十点,马辽起身,“走?”



    赵元任看了眼自己处理后的文本,数据量比上午减少了百分之四十,心想已经够了,但他很快打开公共仓库看了眼,顾彦平的已经清洗完了。



    还写了一篇文档给他们看:“数据清洗第一天。”



    他下意识道:“算了,马里奥,你先走吧,我再看看。”



    “......别指望靠规则去判断内容质量,格式混乱的内容不一定就没有价值,格式标准的内容也可能全是垃圾。



    以这篇内容为例,这是标准的垃圾内容...”



    接下来是举例,一篇营销软文,前面在讲失眠危害,中间列几个毫无意义的常识,最后开始推销保健品。



    “这种格式标准,如果按照我们过去的处理逻辑,那么规则一定会认为它质量很高,然而事实是,这就是垃圾。



    因此我们需要专门训练一个分类模型,需要做数据标注。



    分类模型,Boss已经写好了,大家可以看看,明天我们需要分出人手来做数据标注。”



    赵元任把分类模型读完之后,惊讶于模型的优美简洁,更震惊于后续的工作。



    要把全部语料抽样,然后再组织人工进行质量评分,要分成十档。



    “走!”他看马辽还没有走,于是保存,关机,起身一气呵成。



    “不得不说,老板的代码写的是真优美。”马辽摇头晃脑地吐槽道。



    赵元任说:“你没看到这模型暗示的任务量吗?那是会死人的!



    人工做数据标注,我们别的活都别干了,全来干这得了。”



    “放心,不可能让你们干这活,大概率是找外包来干,把规则制定好。”



    “那我就放心了。”



    赵元任接着好奇问道:“不是,那你说BetaCode的数据清洗和数据处理是谁做的?那时候Boss应该找不起外包吧。”



    马辽说:“未必就不是Boss自己做的,一个可用的代码模型,背后的数据采集、预处理和训练,至少光是从我们两个负责的板块来看,Boss的水平是真的高。”



    “有多高?”



    “大概一二十层楼那么高吧。”



    

章节目录