八个月前我啃完一门深度学习课程,笔记本上画满示意图。前阵子想把笔记整理成文,回头一翻才发现——大部分知识确实记住了,但几个定义早就糊成一团。其中一处混淆,要是不在动笔时揪出来,拿到面试现场铁定扣分。
说白了,这行新人撞上的第一堵墙就是术语大乱炖。AI、ML、DL、DS被说得好像可以随便换用,实际根本不是同一回事。早点把这张谱系图刻进脑子里,以后面试能省掉大量说不清楚的尴尬。
![]()
四兄弟一张图
先上最直观的切法:
- AI是整个宇宙。连写死规则的国际象棋引擎也算AI,哪怕它从来没“学”过什么。
- ML是AI的一个子集。不硬编码规则,直接从数据里扒模式。
- DL又是ML的子集。用层层人工神经元模仿大脑处理信息,图像、音频、文字这些非结构化数据就是靠它才变得能处理。
- 数据科学不是谁的子集,它是横切一刀的横向学科。数据科学家从收原始数据到把模型推上生产环境,三层都得碰。
有监督学习手里有标注数据——每行都是已知的输入对应已知的输出。输出是个连续值(房价、温度),就叫回归;输出是个类别(垃圾邮件/非垃圾邮件、电影类型),就叫分类。几种类别还分得更细:两类是二分类,三类及以上且互斥是多分类,而一条数据能同时挂上多个标签——比如一部电影既标“动作”又标“惊悚”——那就是多标签分类,跟普通多分类是两码事。
无监督学习一个标签都没有,模型得自个儿在数据里找结构。最经典的例子就是客户分群:只靠工资和消费分数,把人自动聚成“高收入高消费”“低收入低消费”这些堆,全程不用告诉模型该叫它们什么名字。
半监督学习卡在中间:一小部分数据有标签,剩下绝大部分没有。教科书上的范例是推荐系统——你拿到了少量明确信号(评分、购买记录),但更庞大的是那些没说出口的隐性行为。
最容易踩的坑:半监督学习不是强化学习
不知道从什么时候开始,有人把半监督学习和强化学习当成差不多的东西在讲。这俩根本不是一回事。强化学习是另一套根本不同的范式——既没有标签,也不靠数据聚类找结构,而是靠智能体在环境里试错、拿奖励信号来学策略。半监督学习仍然是传统那块“从数据里找规律”的板子,只是多了些没标签的样本帮着把边界画得更准。面试官要是随口一问,把这个当成同义词,那场面就不好看了。
重新翻一遍旧笔记,自己给自己讲一遍,这才是最快分清“真懂了”和“以为懂了”的办法。术语这道门坎,早厘清早省心。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.