没想到吧,中文互联网上最好的大模型语料库是:弱智吧 没想到吧,中文互联网上最好的大模型语料库是:弱智吧
admin
2024-04-04 11:56:42
0


作者 | 苗正
邮箱 | miaozheng@pingwest.com

如果让你在互联网上给大模型选一本中文教材,你会去哪里取材?是知乎,是豆瓣,还是微博?一个研究团队为了构建高质量的中文指令微调数据集,对这些社交媒体进行了测试,想找到训练大模型最好的中文预料,结果答案保证让你大跌眼镜——

弱智吧。

弱智吧是百度贴吧上的一个子版块,这是一个非常神奇的地方,吧友们热衷于创作和分享一语双关、一词多义、因果倒置、谐音梗等带着逻辑陷阱的内容,而且部分帖子甚至带有一定的哲学意味。但是,拿这些东西训练全知全能伟大的大模型?能行吗。

别急,我们先来看看这个研究团队做了什么实验。


这是一篇题为《COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning》的论文,作者来自多个国内外高校,简单来说,他们提出了一个中文指令微调数据集COIG-CQIA(全称为Chinese Open Instruction Generalist-Quality Is All You Need )。

对于中文大模型开发者来说,目前的一个重点挑战就在于没有一个高质量中文数据集,研究团队认为,各种中文社交媒体、论坛对于大模型的训练应该是很好的语料来源。

于是为了给这个数据集取材,他们从不同的社交平台(如问答社区、维基百科、考试材料、已有的 NLP 数据集等)收集了高质量的人工编写的文本集合,这些文本经过严格筛选和细致处理,最终才构建出了这个数据集。


论文称,这个数据集的目的是构建一个多样化、广泛的服务于中文大模型的指令调优数据集,以更好地使模型行为在中文环境下与人类互动相一致,提高指令响应的能力。

这里也科普一个概念,那就是大模型虽然有强大的知识储备,但是它是为解决通用自然语言处理任务而设计的,因此没有办法处理特定问题。此时,就需要对其进行“微调”,来让其输出结果符合特定问题的预期。而指令微调就是说明确了模型应执行的任务类型、输入要求、输出格式等具体细节情况下,再给出正确的结果。比如我用中文提问,并要求模型用西班牙语回答,那么模型的开发者为了满足我后半句话的要求,就得对模型进行指令微调。

这时就需要一个“指令微调数据集”。这类数据集通常包含大量的“指令-输出”对,其中每个对包括一个明确的指令(instruction),即用户希望模型执行的任务说明,以及与之对应的理想输出(output),即模型在接收到该指令后应当生成或执行的结果。

COIG-CQIA就是这样一个数据集。研究团队首先是对数据集进行了严格的筛选和清洗,确保数据集是比较健康的。具体做法是根据预设的筛选标准,去除无关或低质量的文本。这可能包括删除广告、无意义的灌水内容、含有敏感信息或违反社区规则的帖子等。

之后,团队还做了人工干预:对处理后的文本进行人工审核,确保其内容正确无误,符合预期的语义和知识标准,同时也确保数据集与真实的中文用户交互模式相一致。尤其是在一些诸如弱智吧语录这样深层隐喻比较强,模型基本没办法完全理解采集到的段子的含义,那就需要进行人工标注,提供明确的指令-输出示例,为模型微调提供精确的训练信号。

在做完了整理工作后,研究团队使用COIG-CQIA数据集对多个开源中文大模型做了微调。

而为了评估这些不同来源的数据质量,团队分别用不同的社交网站的数据微调了同一个模型,并做了测试。

在论文展示的对微调后的Yi系列模型的评估表现中,神奇的一幕出现。

在Yi-6B的性能对比中,在多个比分中(开放式问答,头脑风暴,分类问题,生成问题,封闭式问答和编程),用弱智吧的数据训练的模型表现在多个分类中表现是最好的。


而对微调后的Yi-34B的评测中,基于弱智吧数据训练出来的表现,更是直接拿了几乎全部领域的第一,综合评分遥遥领先。


除了性能外,COIG-CQIA还对其安全性能进行测试了,使用的是开源评估框架SafetyBench。可以看到,CQIA-Sub-6B的SafetyBench高达81.7,比GPT 3.5的SafetyBench还高。这么高的评分代表COIG-CQIA能够准确识别风险,并区分出含有有害信息、潜在违规内容、隐私敏感信息、误导性建议等不安全选项,选择出最符合安全原则的答案。换句话说,其具备一定的商业化潜力。

而其中,弱智吧的表现又亮了。超过了GPT3.5 。


论文里也对此感到惊讶,作者尝试做了分析:“有意思的是,弱智吧数据集在多个子集上的平均排名中最终位居第二,我们认为这可能是因为弱智吧的数据特性有助于增强模型的逻辑推理能力,从而在大多数遵循指令的任务中表现出色。”

在看完这篇论文后,我又去弱智吧看了看这些天才般的语料,这是有人整理的一部分弱智吧经典语录:


玉皇大帝住的是平流层()还是对流层?

导盲犬禁止入内,是给盲人看的,还是给导盲犬看的?

空腹能吃饭吗?

变形金刚买保险是买车险还是人险?

我买了一斤藕,为什么半斤都是空的?

雷公电母放的是直流电还是交流电?

每天吃一粒感冒药,还会感冒吗?

请问孕妇打人算群殴吗?

去自首的路上被抓了还算自首吗?

吃止痛药去打架,算开挂吗?

被门夹过的核桃,还能补脑吗?


考虑到大模型最欠缺的就是逻辑能力,看来这些更像脑筋急转弯的问答确实是大语言模型的好语料。

而在弱智吧最近的首页上,一个排名靠前的帖子也很应景:


“什么工作都可能会被人工智能取代,但弱智不会。”

真的,有道理呢。


相关内容

热门资讯

摩通:华尔街银行业绩强劲提振欧... 观点网讯:7月22日,华尔街大型银行第二季度业绩表现强劲,提振了市场对欧洲投资银行即将开启的财报季的...
广州拟推动房地产纾困和发展 引... 观点网讯:7月22日,“十五五”时期,广州拟切实推动房地产纾困和发展,引导房地产市场企业转型升级。 ...
AI投入成“无底洞”?谷歌资本... 隔夜美股三大指数集体收低,道琼斯工业指数下跌0.01%报52218.58点,标普500指数跌0.14...
新太空经济从“起势”迈向“成势... 当前,全球正处于新一轮科技革命和产业变革加速演进的关键节点,人工智能、合成生物学、固态电池、高端算力...
金价四连涨,水贝又挤满人 每经记者:赵景致 每经编辑:何小桃,廖丹 记者|赵景致 编辑|何小桃 廖丹杜恒峰校对|金冥羽 金价在...
专访微亿智造董事长张志琦:在“... 本报(chinatimes.net.cn)记者石飞月 上海报道 在刚刚过去的2026世界人工智能大会...
Alphabet CEO:市场... 美东时间周三(7月22日)盘后,在Alphabet财报电话会上,公司CEO Sundar Picha...
毕马威:香港基金税制改革料吸引... 观点网讯:7月22日,毕马威发布《香港资产管理及私募股权展望》报告,指出香港基金免税制度及附带权益税...
维护资本市场平稳运行,组合拳来... 重要新闻提示 7月20日,证监会召开证券公司及基金机构座谈会,听取各方关于促进资本市场平稳健康发展的...
原创 缩... 其实这个阶段,反攻继不继续,对我来说没啥意义。因为小登估值依旧高高在上,随时可能像上周五,带崩老登。...
易方达张坤,罕见调仓 图/视觉中国 昔日公募圈“一哥”,也不“爱”白酒了。 7月21日,易方达知名基金经理张坤旗下多只产品...
宽基ETF连续2日净流出 7月23日,本周二、周三,宽基ETF连续2日资金流出。 数据显示,7月22日,ETF市场净流出216...
367 款新品换不来年轻人一句... 作者|极点商业 张先森 2026年初夏,#康师傅冰红茶卖不动了#登上热搜。 网友对此的反应颇为两极...
1元净资产市场只给5毛8!银行... 继中信银行、招商银行之后,光大银行也于7月20日在投资者互动平台透露,该行已成立市值管理小组,全面统...
风险等级为何需要运作机制更关键... 在基金投资领域,风险等级是投资者评估基金产品的重要参考指标之一。然而,很多投资者往往只关注风险等级的...
刚刚!万亿“光模块一哥”正式招... (来源:上市之家) 7月22日,中际旭创股份有限公司(300308.SZ)正式刊发H股招股章程,启动...
智象未来完成15亿元C轮融资,... 智象未来(合肥)信息技术有限公司(以下简称“智象未来”)是一家全球多模态生成式人工智能创新企业,也是...
半年赚170%、规模565亿,... 来源:市场资讯 来源:资管网 半年赚170%,管理规模从89亿干到565亿。 然后他减仓了。 财通基...
Token账单背后的资本博弈 最近大家可能有一个困惑:为什么大模型概念股,看似业务高速增长、调用量节节攀升,但估值在经历了高速攀升...
Costco签约入驻 京东成为... 观点网讯:7月22日,全球知名会员制仓储零售商Costco(开市客)与京东达成合作,京东成为Cost...