ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Data Science For Beginners 数据科学生命周期全解析:捕获、处理与维护三大核心阶段实战指南

Data Science For Beginners 数据科学生命周期全解析:捕获、处理与维护三大核心阶段实战指南 Data Science For Beginners 数据科学生命周期全解析捕获、处理与维护三大核心阶段实战指南【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners数据科学不是一次性任务而是一个持续运转的过程。本文基于 Data Science For Beginners 课程第 14 课位于 4-Data-Science-Lifecycle/14-Introduction系统讲解数据科学生命周期的五大阶段并重点深入捕获Capturing、处理Processing与维护Maintaining三大环节。读完本文你将掌握每个阶段要回答的关键问题、存储与安全的核心决策点并能通过仓库内置的纽约出租车数据集作业亲手完成一次捕获阶段的实战演练。图片由 Berkeley School of Information 提供完整展示了数据从采集到维护的全过程流动。一、数据科学是一个过程五阶段生命周期总览进入本课之前你或许已经隐约意识到数据科学是一套完整的过程而非某个孤立的操作。这个过程可以被拆解为五个阶段捕获Capturing获取数据并明确要解决的问题与目标处理Processing发现数据中的模式并开展建模分析Analysis确认数据能否回答最初提出的问题对应课程 15-analyzing核心是探索性数据分析 EDA沟通Communication将分析结论有效传递给决策者对应课程 16-communication维护Maintaining贯穿全程的数据管理、存储与安全保障。本课聚焦其中三个部分捕获、处理与维护。在课程体系见 4-Data-Science-Lifecycle/README.md中这三课共同构成数据科学生命周期模块是后续上云5-Data-Science-In-Cloud等进阶内容的基础。二、捕获Capturing目标定义与数据采集的双重起点捕获阶段是整个生命周期中最关键的一环因为后续所有阶段都依赖于它。它实际上是两个子阶段合二为一一是获取数据二是定义需要解决的目的与问题。2.1 定义项目目标先回答为什么做定义项目目标需要深入理解问题或提问背后的语境。首先要识别并接触那些需要解决其问题的人——他们可能是业务中的利益相关者stakeholders或项目赞助方sponsors能够帮助识别谁或什么将从这个项目中受益他们需要什么以及为什么需要。一个定义良好的目标必须是**可测量measurable且可量化quantifiable**的这样才能界定一个可接受的结果。在此阶段数据科学家应当追问的问题包括这个问题以前有人处理过吗发现了什么所有相关人员是否都理解了目的与目标是否存在歧义如何减少歧义有哪些限制条件constraints最终结果可能长什么样可用资源时间、人员、算力有多少2.2 采集数据评估数量与质量接下来是识别、收集最后是探索达成目标所需的数据。在这一采集环节数据科学家还必须评估数据的数量与质量这需要一定的数据探索来确认所获取的数据足以支撑我们达成期望结果。关于数据数据科学家应当追问的问题包括我现在已经有哪些数据这些数据的归属者是谁有哪些隐私方面的顾虑我的数据量足够解决这个问题吗这批数据的质量能否满足问题需要如果通过数据发现了额外信息是否应考虑更改或重新定义目标从源码结构看仓库在 4-Data-Science-Lifecycle/14-Introduction/assignment.md 中为捕获阶段设计了一套可落地的评估流程并在 notebook.ipynb 中演示了用 Pandas 加载真实数据集的方法稍后的实战章节会详细展开。三、处理Processing模式发现与机器学习的交汇点处理阶段专注于在数据中发现模式以及建模modeling。这一阶段使用的某些技术需要借助统计学方法来揭示模式。对大型数据集而言人工完成这项工作将极其枯燥因此通常依赖计算机来加速这一过程。这一阶段也正是数据科学与机器学习交汇的地方。正如本课程第一课所学机器学习是构建模型以理解数据的过程而模型则是数据中变量之间关系的表示能够帮助预测结果。本阶段常用的三类技术在微软 ML for Beginners 课程中均有系统讲解分类Classification将数据组织到类别中以便更高效地使用聚类Clustering将数据归入相似的分组回归Regression确定变量间的关系用于预测或预报数值。说明分类、聚类、回归的详细原理属于机器学习课程范畴本课仅需理解它们是处理阶段常用的建模手段即可。四、维护Maintaining贯穿全程的存储、管理与安全在生命周期示意图中你会发现维护阶段夹在捕获与处理之间。维护是一个贯穿项目全过程的持续性过程负责数据的管理、存储与安全且必须在项目的整个存续期内持续考量。4.1 数据存储Storing Data数据的存储方式与位置会影响存储成本以及数据访问的速度性能。这类决策通常不会只由数据科学家做出但数据科学家很可能需要根据数据是如何存储的来决定如何与之协作。现代数据存储系统中有几个关键维度会左右这些决策本地On Premisevs 异地Off Premisevs 公有云 / 私有云本地On Premise在自己的设备上托管管理数据例如自购一台带硬盘的服务器来存放数据异地Off Premise依赖你不拥有的设备例如数据中心公有云Public Cloud存储数据的流行选择无需了解数据具体如何、在哪里存储——这里的公有指底层基础设施统一、且由所有云使用者共享私有云Private Cloud部分组织有严格的安全策略要求对托管数据的设备拥有完全访问权因此会依赖提供自有云服务的私有云。关于云上数据的进一步内容可参见课程的后续章节 5-Data-Science-In-Cloud。冷数据Coldvs 热数据Hot训练模型时你可能需要更多训练数据而当模型已满足要求后为让模型持续发挥作用仍会有新数据持续到来。无论哪种情况随着数据累积存储与访问的成本都会上升。将**极少使用的数据冷数据与频繁访问的数据热数据**分离是通过硬件或软件服务实现更经济存储的一种选择。如果确实需要访问冷数据其检索时间通常会比热数据稍长。4.2 数据管理Managing Data在数据处理过程中你可能会发现部分数据需要清洗以构建精确的模型——相关清洗技术可参考课程中的 数据准备08-data-preparation 一课。当新数据到来时同样需要应用这些方法来维持质量的一致性。部分项目会使用自动化工具在数据被移动到最终位置之前完成清洗cleansing、聚合aggregation与压缩compression。例如 Azure Data Factory 就是这样一类工具。4.3 数据安全Securing the Data数据安全的主要目标之一是确保与数据打交道的人员能掌控收集了什么数据、在什么语境下使用。保持数据安全涉及仅向真正需要的人开放访问权限、遵守当地法律法规以及维持伦理标准——后者在课程的 伦理02-ethics 一课中有专门讲解。团队在安全方面可以采取的行动包括确认所有数据均已加密encrypted向客户告知其数据的使用方式移除已离开项目人员的访问权限仅允许特定项目成员修改数据。五、挑战横向对比 TDSP 与 CRISP-DM 两大生命周期数据科学生命周期存在许多版本每个步骤可能名称不同、阶段数量不同但本质上都包含本课提到的相同过程。课程挑战环节要求你对比两个业界知名框架并指出二者的 3 个相似点与 3 个不同点| 团队数据科学过程TDSP | 行业标准数据挖掘过程CRISP-DM | |--|--| |||TDSPTeam Data Science Process微软提出的团队级协作流程强调角色分工与任务的执行提供角色、任务与部署相关的资源CRISP-DMCross-industry standard process for data mining跨行业标准数据挖掘过程被广泛视为数据挖掘项目的行业基线方法论。建议在对比时重点观察两者各自包含几个阶段、阶段命名差异、对业务理解和部署/维护环节的侧重程度以及它们对团队角色分工的描述方式。六、仓库配套实战用纽约出租车数据完成一次捕获演练为帮助你把捕获阶段的抽象概念落到实操仓库提供了配套作业 评估一个数据集Assessing a Dataset。场景设定如下一位客户请求你的团队调查纽约市出租车乘客的季节性消费习惯。他们想知道纽约市的黄色出租车乘客在冬季给司机的小费是否比夏季更多你的团队正处于数据科学生命周期的捕获阶段由你负责处理数据集。作业提供了 notebook 和数据文件供你探索数据文件data/taxi.csv来自纽约出租车与轿车委员会NYC Taxi Limousine Commission的黄色出租车行程数据共 199 行行程记录探索 notebooknotebook.ipynb演示了用 Python Pandas 加载数据的过程。6.1 从 notebook 看标准加载流程notebook 中的核心代码展示了捕获阶段先装载、再审视的典型做法import pandas as pd path ../../data/taxi.csv # 将 CSV 文件载入 dataframe df pd.read_csv(path) # 打印 dataframe print(df)从 notebook 的输出可以看到df是一个200 行 × 18 列的数据框包含VendorID、tpep_pickup_datetime上车时间、tpep_dropoff_datetime下车时间、passenger_count、trip_distance、tip_amount小费金额、fare_amount车费、payment_type支付方式、total_amount总金额等字段。其中tpep_pickup_datetime的取值横跨 2019 年 1 月冬季与 2019 年 7 月夏季这正是回答冬夏小费差异问题的关键时间维度。你也可以用文本编辑器或 Excel 之类的表格软件直接打开 taxi.csv 查看原始数据。6.2 作业要求三件事评估数据可用性判断这份数据集是否能够帮助回答客户的问题例如是否有季节信息是否有足够的小费记录支付方式字段是否会影响小费统计补充数据源浏览纽约市开放数据目录NYC Open Data catalog找出一个可能对回答客户问题有帮助的额外数据集如天气数据、节假日数据等向客户提问写出 3 个用于澄清和更好理解问题的问题例如小费更多如何量化是按绝对金额还是按小费比例。作业还建议参考数据字典data dictionary和用户指南user guide来了解各列含义评分标准Rubric分为卓越 / 合格 / 需改进三档。6.3 与下一课的自然衔接完成捕获阶段的评估后如何用统计与可视化手段验证数据是否足够、质量是否合格这正是下一课 分析15-analyzing 的主题——它聚焦探索性数据分析EDA介绍 Pandas 的describe()描述性统计、sample()采样与query()查询等工具并强调在数据彻底清洗前就可以用可视化辅助发现模式与异常。两课连读即可完整走通捕获 → 分析的闭环。七、复习与自学建议应用数据科学生命周期往往涉及多种角色与任务不同成员可能专注于各阶段的特定部分。TDSP 提供了若干资源解释了一个人在项目中可能承担的角色与任务类型TDSP 中的角色与任务Roles and tasks执行数据科学任务探索、建模与部署Execute data science tasks: exploration, modeling, and deployment。自学时可以对照本课生命周期图逐阶段自问当前项目处于哪个阶段该阶段要回答哪些关键问题数据是否安全、存储是否经济、目标是否可量化将这些清单沉淀为可复用的项目检查表是掌握生命周期的最高效路径。小结数据科学生命周期把数据科学从写代码跑模型的单一视角提升为一套可管理、可度量的工程流程捕获阶段回答为什么做、数据从哪来、够不够、好不好处理阶段借助统计与机器学习从数据中发现模式、构建预测模型维护阶段以存储选型本地/云、冷/热、数据清洗自动化和安全管控保障全程数据质量与合规通过 TDSP 与 CRISP-DM 的横向对比可以建立对生命周期变体的整体认知使用仓库内置的纽约出租车数据集作业即可在真实数据上完整体验捕获阶段的评估、提问与探索全过程。掌握这三步你便具备了把任意业务问题拆解为数据科学项目的底层思维框架。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进