上周我把一张哈士奇饱A不算最新欧博的照片丢给某个图像识别AI,它愣了三秒,回我一句“狼,概率87%”了。成绩不正在算法。正在锻炼它的数据集里,哈士奇年夜要都跟狼混正在一路。

那事儿特逗了。也特实正在是它再伶俐,也得先吃对饭。数据集就的堆堆是AI的食堂。科技公司抢数据比抢菜还狠。昔时李飞飞搞ImageNet,攒了1400万张图片,才让机械教会认猫认狗的。你认为机械自己长眼睛?
背后是无数标注员一张张点出来的。我朋友做过兼职标注。
一天标两千张图的,看到猫都念吐法那,所以下次它认错,不要骂它笨,骂它吃的数据集太纯。我自己捣鼓过一个小项目。念锻炼模子分辩垃圾邮件。功效数据集里把“发票”全标成垃圾,模子连正经发票也拒了。那就像教小孩认生果,你非说西红柿是蔬菜,他当前看见西红柿就懵。
数据集数据的偏见更吓人,某雇用AI果为历史数据里男性简历多,主动给女性降分。科技背善?先洗清洁数据再说。
如今年夜模子火了,数据集更夸年夜。Common Crawl爬全网,电子书、代码、论坛全往里塞的。AI公司四处薅数据,你的朋友圈、微博。说不定正正在锻炼下一个模子。不要慌了,清洗和脱敏也正在跟上了。只是版权和隐私那笔账,早早要算。我总觉得的,科技跑太快,执法和伦理正在后面逃得气喘嘘嘘。下次它答非所问,不要怪它智商低,先看看它吃了什么数据集啊?
喂好数据,比堆算力重要多了。究竟了局。再炫的科技,底层都是苦活累活。
念让人工智能实伶俐,先把那堆数据集的烂叶子挑清洁。






