1. 监督学习、无监督学习、半监督学习与强化学习的区别是什么,各自典型任务(分类/回归/聚类/决策)是什么?
监督学习、无监督学习、半监督学习与强化学习之间的区别是什么?它们各自的典型任务(分类、回归、聚类、决策等)是什么?
- 四种学习范式对"标签"的依赖程度
- 各范式对应的典型任务与算法
- 训练数据与目标函数的形式差异
监督学习依赖带标签的样本,目标是学习输入到输出的映射,典型任务包括分类(离散标签)与回归(连续值),常见算法有逻辑回归、SVM、决策树、神经网络。无监督学习没有标签,目标是从数据中发现结构,典型任务包括聚类(K-Means、DBSCAN)、降维(PCA)、关联规则与密度估计。半监督学习利用少量有标签样本加大量无标签样本,通过伪标签或一致性正则化提升性能,常用于标注成本高的场景。强化学习则通过智能体与环境交互,依据奖励信号(reward)学习决策策略,目标是最大化累积回报,典型任务有游戏、机器人控制、路径规划;其核心是"探索-利用"权衡与马尔可夫决策过程(MDP)。四者的根本区别在于反馈形式:监督/无监督依赖静态数据集,强化学习依赖与环境动态交互的奖励信号。
面试中应抓住"标签/反馈来源"这一主线来区分。监督学习需要正确标签,无监督不需要标签,半监督介于两者之间,强化学习用延迟的奖励而非即时标签。这决定了各自适用的问题形态与数据成本。