从零搭建数据分析环境:conda + numpy + Jupyter 实战指南 📅 发布时间:2026/8/31 16:48:49 👁 浏览次数: 数据分析环境往往是新手第一个“劝退点”装 Python、装 Anaconda、敲pip install、又碰见jupyter不是命令环境变量、依赖版本、内核切换每一步都可能出问题。这篇文章直接把“数据分析-2-3 环境创建、安装 numpy、Jupyter、创建项目”这条路完整走一遍从空环境开始到能打开浏览器写 Notetbook再到建好项目目录跑通第一个数组运算。我会用conda 创建独立环境 → 安装 numpy → 安装 Jupyter → 建立数据分析项目这条主线把每个环节的命令、验证方法、常见报错都写清楚。这套流程在 Windows / macOS / Linux 上思路一致区别只在终端操作方式我会单独标注。适合读这篇文章的读者有三类刚入门数据分析、想从零搭一套干净环境的人想用 Jupyter Notebook 做数据探索和可视化验证的开发者以及准备系统学习 numpy、pandas、matplotlib但还没理清环境工具的初学者。1. 核心能力速览能力项说明环境管理通过 conda 创建独立 Python 环境避免多个项目依赖互相冲突numpy 安装与验证使用 pip 安装 numpy并通过导入和输出版本号确认可用交互式数据分析使用 Jupyter Notebook / JupyterLab 进行逐单元格执行和可视化验证项目目录规范建立 data / notebooks / scripts / output 标准结构方便数据管理和结果复用操作系统兼容Windows / macOS / Linux 均可使用 conda 屏蔽底层差异硬件要求数据分析入门不要求独立显卡普通 CPU 4GB 以上内存即可工具链扩展后续可继续安装 pandas、matplotlib、seaborn、scikit-learn这套组合是目前 Python 数据分析最主流的基础配置。环境一旦搭好后续的 numpy 运算、pandas 清洗、matplotlib 画图都在同一个环境里工作不会因为装了某个新库导致之前能跑的代码突然报错。2. 适用场景与使用边界2.1 适合什么场景教学和入门学习。数据分析初学者需要快速验证语法和算法逻辑Jupyter Notebook 的“写一段跑一段”方式明显比“写完整个脚本再运行”更高效。每运行一个单元格数组结果和图表直接显示在下方适合理解 numpy 的广播机制、切片操作和统计函数。数据探索和可视化验证。拿到一份 CSV 或 Excel 数据先用 pandas 读取再用 matplotlib / seaborn 画分布图这个过程天然适合在 Notebook 中完成。你可以边看边改每一步输出都留着最后整理成一份可分享的分析报告。算法原型验证。在写正式脚本之前先用 Notebook 验证特征计算、数据切分、模型评估等环节。确认逻辑没问题之后再把核心代码抽到scripts目录里的.py文件中复用给后端服务或批量任务。2.2 不适合什么场景生产级定时任务。如果数据每天自动更新需要定时跑批处理不建议依赖“手动打开 Jupyter 点击运行”。更适合把逻辑写成 Python 脚本用crontab、Windows 任务计划程序或专业的调度工具执行。超大数据量处理。numpy 和 pandas 处理的是“能装进内存”的数据。当单表数据量到达几十 GB 甚至更大时单机内存会成为瓶颈此时需要考虑 Spark、DuckDB 或分布式计算方案。多人实时协作开发。Jupyter Notebook 的 diff 和 review 体验不如普通 Python 文件方便。如果团队需要做严格代码评审建议把核心逻辑抽离成.py模块Notebook 只做分析和展示。2.3 使用边界与合规提醒数据分析环境中经常涉及业务数据、用户信息、财务数据等敏感内容。在本地环境运行和测试时要注意原始数据脱敏、访问权限控制和分析结果发布的合规性。不要把人脸信息、联系方式等隐私数据直接放进公开的 Notebook 或示例代码中。3. 环境准备与前置条件3.1 安装 Anaconda 或 Miniconda数据分析环境创建最推荐的方式是安装 Anaconda 或 Miniconda。Anaconda 自带 conda、Python 和常用数据科学库适合初学者Miniconda 只带 conda 和 Python体积小适合需要自己控制环境内容的用户。下载方式去 Anaconda 官网或 Miniconda 官方页面下载对应操作系统的安装包。安装后打开终端Windows 可打开 Anaconda PromptmacOS / Linux 打开 Terminal。3.2 检查 conda、python、pip 是否可用先确认 conda 本身可用再确认环境里是否有 Pythonconda --version python --version pip --version如果输入pip --version出现类似 “pip 不是内部或外部命令” 的提示说明 pip 可执行文件没有加入 PATH。这个问题的根因通常是 Python 脚本目录没有被系统识别。可以先验证 conda 是否正常conda --version如果 conda 正常建议先执行下面的conda activate激活基础环境再尝试python -m pip --versionpython -m pip --version这里优先推荐用python -m pip而不是直接敲pip。前者不依赖 PATH 中的可执行文件只要当前 Python 环境里有 pip 模块就能运行能规避大多数环境变量问题。3.3 磁盘与网络检查创建 conda 环境会下载 Python 解释器以及 numpy 等依赖包建议至少预留 3GB 到 5GB 磁盘空间。如果网络下载较慢可以给 conda 和 pip 配置国内镜像源。4. 创建 conda 数据分析环境4.1 为什么不用默认的 base 环境刚安装完 Anaconda默认会进入base环境。如果所有项目都装在base里时间一长会出现版本冲突。比如 A 项目需要 numpy 1.xB 项目需要 numpy 2.x装在同一个环境里很难两全。用 conda 为每个项目创建一个独立环境是更稳妥的做法。4.2 创建新环境这里我们创建一个名为>conda create -n>conda activate>conda init powershellmacOS / Linux 下如果出现conda: command not found一般是安装时没有把 conda 添加到 shell 配置可以执行conda init bash然后重新打开终端。4.3 查看和删除环境查看当前机器上所有 conda 环境conda env list输出类似base /opt/anaconda3>conda deactivate conda env remove -n>pip install numpy如果下载速度慢可以使用清华大学 PyPI 镜像pip install numpy -i https://pypi.tuna.tsinghua.edu.cn/simple如果之前已经安装过某个早期版本现在想升级pip install --upgrade numpy5.2 验证 numpy 是否安装成功安装完成后不要只看到 “Successfully installed” 就结束建议做一次完整验证。在终端中依次执行python -c import numpy as np; print(np.__version__)如果能看到类似1.26.4或更高版本的输出说明 numpy 导入正常。为了确认当前环境使用的是我们自己创建的 numpy而不是系统 Python 里的旧版本可以打印 numpy 的文件路径python -c import numpy as np; print(np.__file__)输出路径中如果包含>python输入以下内容import numpy as np arr np.arange(10) print(arr) print(arr.reshape(2, 5)) print(arr.sum()) print(arr.mean())如果都能正常输出说明 numpy 的数组创建、形状变换和统计计算功能都可用。输入exit()退出 Python 交互模式。6. 安装 Jupyter Notebook / JupyterLab6.1 Notebook 和 JupyterLab 怎么选Jupyter Notebook 和 JupyterLab 是 Jupyter 项目的两种界面。Notebook 是经典的“单元格 输出”交互界面打开就能用JupyterLab 是升级版可以在同一个浏览器窗口中打开多个 Notebook、终端、文件管理器方便管理单个项目。对于数据分析入门推荐直接使用JupyterLab。它的操作习惯更接近现代 IDE后续做表格查看、拖拽上传文件、并行编辑多个 Notebook 都更方便。如果机器配置比较旧或者只想要最简单的体验再考虑经典 Notebook。6.2 安装 Jupyter在>pip install jupyterlab notebook安装完成后先确认 jupyter 命令是否能正常识别jupyter --version如果出现jupyter 不是内部或外部命令说明 jupyter 可执行文件不在 PATH 中。此时不要急着改系统环境变量推荐直接用 Python 模块方式启动python -m jupyterlab6.3 启动 JupyterLab在终端中启动 JupyterLabjupyter lab默认启动地址是http://127.0.0.1:8888/lab。启动后终端会显示访问令牌token浏览器会自动打开页面。如果浏览器没有自动打开手动复制终端输出的 URL 到浏览器访问即可。如果 8888 端口被占用可以指定其他端口启动jupyter lab --port 88896.4 切换 Notebook 工作目录JupyterLab 打开后左侧文件树默认展示当前工作目录。如果需要切换到其他项目目录有两种方式。方式一在启动后使用os.chdir切换import os os.chdir(/Users/yourname/data-analysis-project) print(os.getcwd())方式二在终端里先进入目标目录再启动 JupyterLabcd /Users/yourname/data-analysis-project jupyter lab推荐方式二。直接在项目目录下启动左侧文件树和新建 Notebook 的默认保存位置就是项目目录之后找路径更省事。7. 创建数据分析项目并跑通第一个任务7.1 标准项目目录结构数据分析项目不建议把数据、代码、图表全堆在一个文件夹。推荐建立一个清晰的项目结构data-analysis-project/ ├── data/ # 原始数据和中间数据 │ ├── raw/ # 原始数据 │ └── processed/ # 清洗后的数据 ├── notebooks/ # Jupyter Notebook 文件 ├── scripts/ # 可复用的 Python 脚本 ├── output/ # 图表、结果文件、报告 └── README.md # 项目说明创建目录的命令mkdir -p>mkdir>pip install ipykernel然后在 Notebook 新建界面的内核选择区刷新后即可看到>import numpy as np amounts np.array([120, 89, 45, 230, 310, 76, 512, 64, 98, 153]) print(订单数据:, amounts)执行后输出订单数据: [120 89 45 230 310 76 512 64 98 153]第二个单元格print(订单总数:, amounts.shape[0]) print(总金额:, amounts.sum()) print(平均金额:, amounts.mean()) print(最大金额:, amounts.max()) print(最小金额:, amounts.min())第三个单元格above_mean amounts[amounts amounts.mean()] print(高于平均金额的订单:, above_mean) print(数量:, len(above_mean))如果三个单元格全部正常输出说明 conda 环境、numpy、Jupyter 内核已经完全打通。7.4 将 Notebook 导出为脚本数据分析验证通过后如果想脱离 Notebook 在后台批量运行可以导出为 Python 脚本。在 JupyterLab 中点击菜单File → Save and Export Notebook As → Export Notebook As → Python或者使用命令行转换jupyter nbconvert --to script notebooks/01-numpy-intro.ipynb转换后的.py文件会放在同目录之后可以像普通脚本一样运行python notebooks/01-numpy-intro.py这也为后续把分析逻辑接入批量任务留了通道。8. 常见问题与排查方法问题现象可能原因排查方式解决方案pip不是内部或外部命令pip 可执行文件不在 PATHpython -m pip --version使用python -m pip install 包名jupyter不是内部或外部命令jupyter 没有加入 PATHpython -m jupyterlab --version使用python -m jupyterlab启动安装 numpy 后无法导入安装到了其他环境的 pip 中which python或python -c import sys; print(sys.executable)确认当前激活环境后再安装module numpy has no attribute trapz使用了错误的 API 名称或 numpy 版本不同np.__version__查看版本检查官方文档数据积分可用 scipy 的scipy.integrate.trapezoidJupyterLab 启动后不在项目目录当前终端路径不对pwd或cd先cd目标目录再jupyter labWindows 下 jupyter notebook 打开后空白浏览器不能访问 localhost 或内核错误检查启动终端日志复制完整 URL 访问使用 JupyterLab 替代或更换浏览器conda 创建环境下载太慢默认源在国外换清华源或北京外国语大学源修改.condarc后重试8.1 pip 无法识别的处理Windows PowerShell 中使用 pip 报错时优先执行python -m pip install numpy如果python命令本身也无法识别说明 Python / Anaconda 的 PATH 配置异常需要检查安装时是否勾选“Add to PATH”选项或重新安装 Miniconda 并选择加入 PATH。8.2 jupyter 无法识别的处理Jupyter 安装成功后直接敲jupyter可能仍然报错。这是因为 jupyter 可执行文件目录不在 PATH。最稳妥的方式是python -m jupyterlab这种写法直接从当前 Python 环境加载模块不依赖 PATH 中的可执行文件。8.3 numpy 的 trapz 属性不存在如果代码中使用np.trapz报错module numpy has no attribute trapz通常是 numpy 版本较新该接口已经调整或移除。建议查看当前 numpy 版本并查阅官方 API 文档确认正确调用方式。如果只是做数值积分可以使用 SciPy 中的积分函数。8.4 conda 创建环境网络慢conda 创建环境时经常卡在Solving environment或下载 Python 包阶段。可以修改用户目录下的.condarc文件channels: - defaults show_channel_urls: true default_channels: - https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/main - https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/r custom_channels: conda-forge: https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud保存后重启终端再执行创建命令。9. 资源占用与性能观察思路9.1 环境体积占用数据分析环境中conda 环境本身会占用几个 GB 的磁盘空间。观察当前环境大小可以在终端中进入环境所在目录du -sh /opt/anaconda3/envs/data-analysis不同系统路径不同Windows 下路径一般在 Anaconda 安装目录的envs文件夹中。这里不给出固定数值实际占用与安装的包数量有关。9.2 JupyterLab 运行时的内存和多进程JupyterLab 启动后会有一个 Jupyter 服务进程。每新建一个 Notebook如果内核选择的是>import numpy as np arr np.random.rand(10000, 10000) print(arr.shape) print(arr.itemsize * arr.size / 1024 / 1024, MB)这样可以估算数组在内存中的占用避免无意识地创建超大数组导致卡顿。9.4 降低资源占用的建议不需要同时打开多个 Notebook后续任务完成就关闭内核。在output目录中集中存放图表和结果减少 Notebook 中巨型对象的长期驻留。加载 CSV / Excel 时先只读取前 1000 行做逻辑验证再全量读取。10. 最佳实践与使用建议10.1 环境创建后立即锁定依赖版本环境配置好之后第一时间导出依赖列表方便以后重建环境pip freeze requirements.txt之后如果要在新机器复现环境conda create -n>import numpy as np arr np.arange(1000).reshape(100, 10) assert arr.sum() arr.sum() print(environment ok)这样能在环境被意外修改时快速发现问题。10.5 合规使用数据数据分析依赖数据但数据来源和用途必须合规。对于包含个人隐私的数据在本地分析时也要注意脱敏不要直接输出到 Notebook 或导出到第三方工具。没有明确授权或来源不明的数据不建议作为练习项目素材。这个边界在数据分析和可视化练习中要始终保持。11. 总结与下一步这篇文章从 conda 环境创建讲到了 JupyterLab 新建 Notebook再到用 numpy 跑通第一次数组分析覆盖了数据分析初学者最容易踩坑的“环境链路”。最容易踩的坑有三个第一个是pip和jupyter命令无法识别解决办法是用python -m pip和python -m jupyterlab第二个是 conda 创建环境时下载过慢解决办法是配置国内镜像源第三个是安装 numpy 后实际导入的是另一个环境的包解决办法是激活环境后检查sys.executable。下一步建议按顺序做三件事在这个环境中继续安装 pandas 和 matplotlib分别做一次 DataFrame 读取 CSV 和数据可视化练习。把 notebooks 目录下的实验性代码抽离到 scripts 目录封装成可复用的函数。找一个实际的数据集例如商品销售明细、城市天气记录等公开数据集完成一个包含数据导入、清洗、统计分析和图表输出的完整小项目。环境搭建只是数据分析的第一步但它决定了后面代码能不能顺利跑起来。建议把conda create和pip install这两个核心命令形成肌肉记忆以后每次新项目都能在十分钟内建好一套干净可用的分析环境。