Data-Science-For-Beginners 实战:在数据采集阶段评估 NYC 出租车数据集能否回答客户问题

Data-Science-For-Beginners 实战:在数据采集阶段评估 NYC 出租车数据集能否回答客户问题 Data-Science-For-Beginners 实战在数据采集阶段评估 NYC 出租车数据集能否回答客户问题【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇指南以 Data-Science-For-Beginners 课程第 14 课的课后作业translations/da/4-Data-Science-Lifecycle/14-Introduction/assignment.md即评估一个数据集为骨架带你走完数据科学生命周期中**采集Capturing**阶段最关键的技能用 pandas 加载原始数据、核对字段与样本构成、评估数据质量与数量是否足以支撑业务结论并学会用追问澄清问题。读完本文你将掌握一套可复用的数据集可行性评估检查清单并能独立判断任何给定数据集能否回答你的业务问题。一、任务背景从客户提问到数据可行性判断该作业给出一个真实业务场景客户委托团队调查纽约市出租车乘客的季节性消费习惯核心问题是——纽约市黄色出租车的乘客在冬天还是夏天给司机的小费更多你的团队正处于数据科学生命周期的 Capturing采集 阶段而你负责处理数据集。你会拿到一个 notebook 和一份数据用于探索数据文件data/taxi.csv纽约市黄色出租车行程记录可直接用文本编辑器或 Excel 等表格软件打开探索 notebook4-Data-Science-Lifecycle/14-Introduction/notebook.ipynb使用 Python 的 pandas 库加载并打印数据。在生命周期的视角下这个任务正好对应 README 中强调的第一阶段它实际上是获取数据与界定需要解决的问题两个子阶段合并而成。定义项目目标需要深入理解问题本身——先确认谁需要解决问题如业务中的利益相关方或项目赞助者再明确谁或什么会从中受益、需要什么、为什么需要。一个界定良好的目标应当是可度量、可量化的以便定义可接受的结果。二、第一步用 notebook 加载数据并观察全貌作业目录中已提供 notebook.ipynb其中包含两个核心代码单元# 安装 pandas 库 !pip install pandasimport pandas as pd path ../../data/taxi.csv # 将 csv 文件加载到 dataframe 中 df pd.read_csv(path) # 打印 dataframe print(df)从 notebook 的保存输出可以看到df是一个200 行 × 18 列的 DataFrame即taxi.csv含表头共 201 行实际样本 200 条。下表是 18 个字段的完整清单及示例值列名示例值含义VendorID2.0 / 1.0行程记录提供方TLC 授权供应商tpep_pickup_datetime2019-07-15 16:27:53上车时间黄色出租车tpep_dropoff_datetime2019-07-15 16:44:21下车时间passenger_count3.0 / 6.0乘客人数trip_distance2.02行程英里数RatecodeID1.0费率代码1标准费率store_and_fwd_flagN是否存储转发记录PULocationID/DOLocationID186 / 233上下车地点 IDpayment_type1.0 / 2.0付款方式1信用卡2现金fare_amount12.0基础车费extra1.0额外费用如高峰附加费mta_tax0.5MTA 州税tip_amount4.08小费金额——本作业的目标字段tolls_amount0.0过路费improvement_surcharge0.3改善附加费total_amount20.38乘客支付总额congestion_surcharge2.5拥堵附加费tip_amount小费与tpep_pickup_datetime上车时间正是回答冬季还是夏季小费更多问题的两个关键列前者是衡量指标后者用于划分季节。官方数据字典与用户指南中对该数据集的字段还有更详细的定义说明可用于进一步核对每一列的业务含义。三、第二步核对样本构成——数据真的覆盖冬夏两季吗在判断数据能否回答问题之前先验证一个基本前提数据集中是否真的同时包含冬季和夏季的样本对 data/taxi.csv 按上车日期做月份统计结果如下2019-011 月冬季100 条2019-077 月夏季100 条这印证了 notebook 输出中的日期范围样例行既有2019-07-15的夏季记录也有2019-01-18的冬季记录。数据集在季节维度上做到了50/50 平衡抽样这一点对后续对比分析非常有利。进一步核对关键字段的分布可以发现数据中值得留意的特征payment_type143 条为信用卡1.057 条为现金2.0——现金支付无法记录小费这是评估数据可用性时必须考虑的重要前提RatecodeID192 条为标准费率1.0少量为其他费率VendorID中甚至出现了一个取值4.0与通常期望的 1.0/2.0 不符属于需要清洗或核实的异常值tip_amount取值范围 0.014.64存在大量 0 值现金支付对应小费为 0。四、第三步评估数据能否回答客户问题4.1 可行性评估数据质量与数量作业的核心指令是评估该数据集中的数据能否帮助回答客户问题。结合上一节的实测结果可以得出以下评估结论有利因素数量维度包含完整的时间字段tpep_pickup_datetime可精确划分冬1 月夏7 月两季冬夏样本各 100 条季节对比结构对称包含tip_amount目标字段且与fare_amount、total_amount等字段可联合分析如计算小费占车费比例消除里程差异带来的偏差。风险因素质量维度仅 200 条样本属于极小样本统计显著性有限不足以支撑高置信度的业务结论payment_type中现金记录占比约 28%现金交易在数据上小费恒为 0会系统性拉低小费均值分析时必须按付款方式分层或剔除现金记录VendorID出现非预期取值 4.0提示数据存在脏值需在 数据准备 阶段处理。初步统计信号在不做任何清洗的情况下冬季平均小费约 1.95、夏季约 2.08若只看非零小费的比例冬季约 71%、夏季约 67%。也就是说均值与比例两个口径给出的方向并不一致——这恰恰说明能不能回答与怎样回答才严谨是两回事数据集提供了原始材料但必须配合清洗、分层和更细的统计口径才能给出负责任的答案。这正是评估环节的意义所在。4.2 识别补充数据集NYC Open Data 目录作业还要求探索 NYC Open Data 目录识别一个额外数据集它可能对回答客户问题有帮助。从业务逻辑推断最值得考虑的候选方向包括天气数据雨雪、气温与乘客出行方式、给小费意愿可能存在相关性天气数据集可为季节性差异提供解释变量节假日/事件日历节日期间的出行模式与小费习惯可能显著不同于普通工作日出租车位置/区划数据Zone 数据将PULocationID、DOLocationID映射到行政区可分析不同区域的小费差异。例如将天气数据按日期与出租车行程时间戳对齐join就能在冬季 vs 夏季之外引入雨天 vs 晴天的维度帮助团队理解季节性差异背后究竟是温度、降水还是其他因素在起作用。这一步体现的正是 README 中采集阶段还需评估数据的数量与质量以及若从数据中发现额外信息是否应考虑调整或重新定义目标的思考方式。4.3 向客户澄清问题的 3 个追问作业要求写出 3 个向客户提出的澄清问题目的是消除歧义、把模糊的业务诉求转化为可量化的分析目标。可参考以下方向作业原文要求自行编写此处给出符合评估逻辑的示例小费更多的度量口径是什么是绝对小费金额、小费占车费的比例还是按行程里程归一化后的单位里程小费不同口径可能得出不同结论。季节的定义边界是什么是否就以冬季1 月与夏季7 月代表还是需要覆盖完整四季、跨多个年份以排除单年异常如极端天气、节假日分布差异客户希望据此做什么决策例如调整司机激励政策、优化冬季运力配置还是评估季节性收入预测模型目标不同对数据量、时间跨度和统计显著性的要求完全不同。这些追问与 README 中数据科学家在采集阶段的自问清单一脉相承问题是否被所有人理解、是否存在歧义及如何消除、约束条件是什么、最终结果可能是什么样、有多少资源时间、人员、算力可用。五、作业输出建议与评估标准完成评估后建议按下述结构组织你的交付物对应作业的Instructions三部分作业要求输出要点评估数据集能否回答问题给出明确的能/不能/有条件能结论并列出样本量、字段覆盖、脏值、现金支付等依据从 NYC Open Data 识别补充数据集说明所选数据集名称、关键字段以及它如何与taxi.csv对接如按日期或区域 ID join写 3 个向客户的澄清问题每个问题附带你希望借此澄清什么的一句话说明课程作业的评分细则Rubric分为三档Exemplary典范/ Adequate达标/ Needs Improvement需改进。要拿到典范档次交付物不仅要有结论更要展示出对数据字段的逐一核对、对样本数量与质量的量化评估、对分析口径如现金支付小费为 0的主动识别以及能体现数据科学生命周期思维数据 → 澄清 → 目标量化的完整推理链条。六、从本作业延伸生命周期中的采集阶段本作业只是 第 14 课数据科学生命周期导论 的实践环节。该课将数据科学拆解为 5 个阶段——采集Capturing、处理Processing、分析Analysis、沟通Communication、维护Maintenance其中采集、处理与维护是本章重点采集Capturing既获取数据也界定问题。数据科学家需要自问已有数据是什么数据归谁所有隐私顾虑有哪些数据量是否足够数据质量是否达标若发现新信息是否应调整目标处理Processing发现数据中的模式并建模常借助统计方法与机器学习分类、聚类、回归完成人工难以胜任的大规模计算。本作业中的小费均值对比正是处理阶段模式发现的雏形。维护Maintaining贯穿项目始终的数据管理、存储与安全工作涉及冷热数据分层、存储位置选择本地/公有云/私有云、数据清洗管线以及加密、权限控制与合规等安全实践。本作业4-Data-Science-Lifecycle/14-Introduction/assignment.md聚焦于生命周期的第一阶段但它训练的能力——判断数据是否足以回答问题——将在处理、分析、沟通各个阶段持续复用。掌握了它你就掌握了数据科学项目第一粒扣子的正确系法。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考