免费开始

机器学习是什么

机器学习/2026-08-12/作者:Presentation Intelligence

如果你在问“什么是机器学习”,最简单的回答是:机器学习是一种让计算机从数据中学习模式,并利用这些模式来进行预测、推荐或决策的方法。与其手动编写每一条规则,不如让人们向系统提供示例,然后由系统从中学习。

NIST 的术语表对机器学习的定义是:能够适应并从数据中学习的计算机系统,以提高准确性。听起来很技术,但日常理解其实很熟悉:系统看到的越多、越有用的示例,它越能识别模式。


用通俗的话解释什么是机器学习

机器学习是人工智能的一个分支。IBMGoogle CloudMicrosoft AzureAWS 都用类似的方式来解释:机器学习使用数据和算法来训练系统,使其能够在未针对每一种情况进行明确编程的前提下进行预测或发现模式。

想象一下教一个孩子识别狗。你不会把每一种可能的耳朵形状、尾巴长度和毛发颜色都列出来。你会给出示例。随着时间推移,孩子学会了这个规律。机器学习的理念类似,只是它用的是数据、数学和算法。


机器学习是如何工作的

bda2577b21c80fe51c8b21e0393dd461.png

大多数机器学习项目都遵循一个基本流程:收集数据、准备数据、训练模型、测试模型,然后再把模型用于新的输入。AWS 关于构建机器学习应用的指南将其描述为一种迭代过程:定义问题、准备数据、创建有用的特征、训练模型、评估模型,并将其用于预测。

垃圾邮件过滤器是一个简单的例子。系统会从标注为“垃圾邮件”和“非垃圾邮件”的电子邮件中学习。在训练过程中,它会发现规律:可疑链接、反复出现的短语、发件人行为或特定的格式。在推理过程中,它会应用学到的内容到一封新邮件上,并预测它是否是垃圾邮件。

关键的词是“预测”。机器学习不会像人那样理解世界。它会找到统计规律。这种能力很强,但也意味着数据的质量至关重要。


常见机器学习类型

机器学习并不是单一的方法。它包含几个主要方向:

类型这里的机器学习用来做什么?示例
监督学习从带标注的示例中学习根据过去的销售预测房价
无监督学习没有标签也能发现模式按行为对客户进行分组
强化学习通过奖励和惩罚进行学习训练一个会下游戏的智能体
深度学习使用分层神经网络图像识别或语音转录

斯坦福 CS229 通过监督学习、非监督学习、神经网络和强化学习等核心主题来教授机器学习。谷歌的 机器学习速成课 同样对初学者很有帮助,因为它用实际案例来讲解这些概念。想要动手实践式的文档时,scikit-learn 用户指南TensorFlow 机器学习基础 都是很扎实的技术参考。


机器学习 vs AI vs 深度学习

人们经常把 AI、机器学习和深度学习混为一谈。它们有关联,但并不相同。

人工智能是一门广泛的领域:构建能够执行与人类智能相关任务的系统,例如推理、语言、感知、学习或决策。机器学习是构建 AI 系统的一种方式。深度学习是一种使用多层神经网络的机器学习。

所以关系很简单:AI 是大的类别。机器学习属于 AI。深度学习属于机器学习。

计算器遵循固定规则,因此不是机器学习。能够通过从用户行为中学习来改进的推荐系统是机器学习。使用深度神经网络的“大语言模型”属于深度学习。


机器学习的真实案例

机器学习已经成为日常生活的一部分。流媒体服务用它来推荐视频。银行用它来检测异常交易。邮件服务用它来过滤垃圾邮件。翻译工具用它来转换语言。搜索引擎用它来理解相关性以及排序信号。

在医疗领域,FDA 会维护一份 具备 AI 功能的医疗器械 清单,其中许多设备使用 AI 或机器学习技术用于影像、诊断或临床支持。这提醒我们:机器学习确实可能很有用,但高风险系统需要测试和监督。

科学领域也是另一个有力的例子。AlphaFold 使用 AI 来预测蛋白质结构,帮助研究人员更高效地开展生物学研究。它表明机器学习不仅用于广告、应用和仪表盘,也能支持科学发现。


为什么数据质量很重要

机器学习模型的效果只和其背后的数据与假设一样好。如果训练数据不完整、有偏差、已经过时,或标注不清,模型就可能学到错误的模式。

例如,使用带有偏见的过往招聘数据训练的招聘模型可能会重复这些模式。若医学模型主要基于某一人群训练,它在另一人群上的表现可能更差。推荐模型可能过于狭窄,只会持续向用户展示更多相同的内容。

良好的机器学习工作包括数据清洗、测试、验证、监控以及人工审核。这也意味着要提出一些令人不安的问题:数据中有哪些群体被代表了?有哪些群体缺失了?如果模型出错会发生什么?


用 Pi 直观地讲解机器学习

1f9e29d6a031e46b3c8662b780f5ffcc.png

机器学习可能感觉很抽象,因为重要的工作往往是看不见的:数据准备、模型训练、评估、部署以及反馈循环。可视化解释能帮助人们看清这一流程。

使用 Pi,你可以把机器学习概念做成演示文稿:从数据到模型的工作流、监督学习与非监督学习的对比、用图表展示模型准确率,或用图标来解释训练与推理。Pi 还可以自定义主题、颜色、布局、图标、图表以及由 AI 生成的视觉内容,这让向学生、客户、创始人或内部团队更容易呈现技术想法。


风险与负责任的使用

机器学习系统可能会出错。它们可能放大偏见、暴露私人信息、制造不公平的结果,或变得难以解释。这就是为什么负责任的 AI 很重要。

NIST AI 风险管理框架为组织提供了一种思考可信 AI 风险的方式。OECD AI 原则强调以人为本的价值、公平、透明、稳健性、安全和问责制。

对初学者来说,重点很简单:机器学习不应只根据准确率来判断。它也应从公平、安全、隐私、可解释性以及现实世界的影响来判断。


结论

机器学习是教计算机从数据中学习模式,并将这些模式应用到新情境中的实践。它是现代 AI 的主要驱动力之一,从推荐与欺诈检测到医疗工具和科学研究。

这个概念很简单,但实践需要谨慎。良好的机器学习需要优质数据、清晰目标、测试、监控以及负责任的使用。最好的模型不只是聪明。它们有用、可靠,并且适合其所影响的人群。


常见问题解答(FAQ)

问:什么是机器学习?

答:机器学习是 AI 的一个分支,计算机从数据中学习模式,并使用这些模式来做预测、推荐或决策。


问:机器学习和人工智能是同一回事吗?

答:不是。AI 是更广泛的领域。机器学习是构建 AI 系统所用的方法之一。深度学习是机器学习中的一个更小类别。


问:机器学习有哪些常见示例?

答:常见示例包括推荐系统、垃圾邮件过滤器、欺诈检测、语音识别、图像分类、翻译工具,以及一些医疗 AI 系统。


问:学习机器学习需要编程吗?

答:不编程也能理解基本概念,但要构建真正的机器学习模型,通常需要具备编程、统计、数据处理和测试等技能。