Excel: xls与xlsx格式转换排坑指南

Excel: xls与xlsx格式转换排坑指南

Excel: xls与xlsx格式转换排坑指南

在日常数据处理中,Excel 文件格式的转换是高频操作。尤其是从旧系统(xls)迁移到新系统(xlsx),或反过来兼容老软件时,坑点层出不穷。今天我们就来聊聊 xls 与 xlsx 格式转换中的那些“坑”,以及如何用 Python 轻松填平它们。### 1. 格式差异:不只是扩展名不同xls 是 Excel 97-2003 时代的二进制格式,而 xlsx 是 Office 2007 之后基于 XML 的压缩格式。这带来了几个关键差异:-文件大小:xlsx 通常比 xls 小很多,因为它是压缩的。-行数限制:xls 最多支持 65536 行,xlsx 支持 1048576 行。-功能支持:xlsx 支持更多新特性,如条件格式、数据透视表等。-兼容性:老软件(如 Excel 2003)无法直接打开 xlsx。这些差异导致转换时容易遇到编码、格式丢失、内存溢出等问题。下面我们直接进入实战。### 2. 环境准备:安装必要的库我们推荐使用pandas+openpyxl(处理 xlsx)和xlrd(读取 xls)组合。注意:xlrd从 2.0 版本开始只支持 xls,不再支持 xlsx,所以别装错。bashpip install pandas openpyxl xlrd### 3. 基础转换:从 xls 到 xlsx最简单的转换,直接读取 xls 再保存为 xlsx。但这里有个大坑:pandas读取 xls 时,如果文件里有日期、公式或特殊编码,可能报错或数据错乱。来看一个带注释的安全示例:pythonimport pandas as pddef xls_to_xlsx(input_path, output_path): """ 将 xls 文件转换为 xlsx 文件 :param input_path: 输入的 .xls 文件路径 :param output_path: 输出的 .xlsx 文件路径 """ # 读取 xls 文件,engine='xlrd' 是必须的,否则 pandas 会尝试用 openpyxl 读取导致报错 df = pd.read_excel(input_path, engine='xlrd') # 处理常见问题:将 NaN 替换为空字符串,避免输出时出现 'nan' 字样 df = df.fillna('') # 保存为 xlsx,index=False 避免写入行索引 df.to_excel(output_path, index=False, engine='openpyxl') print(f"转换成功: {input_path} -> {output_path}")# 使用示例if __name__ == "__main__": xls_to_xlsx("old_data.xls", "new_data.xlsx")坑点提醒:如果 xls 文件里有合并单元格或宏,pandas会忽略它们。如果需要保留这些,要用xlutilspyexcel等更底层的库,但这里不展开。### 4. 反向转换:从 xlsx 到 xls从 xlsx 转 xls 更麻烦,因为pandasto_excel不支持直接写 xls(需要xlwt库,但它已停止维护)。而且 xlsx 的行数可能超过 xls 限制,导致转换失败。来看一个稳健的转换函数:pythonimport pandas as pddef xlsx_to_xls(input_path, output_path): """ 将 xlsx 文件转换为 xls 文件 :param input_path: 输入的 .xlsx 文件路径 :param output_path: 输出的 .xls 文件路径 """ # 读取 xlsx 文件,engine='openpyxl' 明确指定 df = pd.read_excel(input_path, engine='openpyxl') # 检查行数是否超过 xls 限制(65536 行) if len(df) > 65535: # 减去表头一行 raise ValueError(f"数据行数 {len(df)} 超过 xls 格式最大行数 65535,请先拆分数据") # 注意:xls 不支持某些数据类型,如 datetime64,需要转为字符串 for col in df.columns: if df[col].dtype == 'datetime64[ns]': df[col] = df[col].astype(str) # 转为字符串避免报错 # 保存为 xls,需要安装 xlwt:pip install xlwt df.to_excel(output_path, index=False, engine='xlwt') print(f"转换成功: {input_path} -> {output_path}")# 使用示例if __name__ == "__main__": xlsx_to_xls("new_data.xlsx", "old_compatible.xls")坑点提醒xlwt不支持写入超过 65535 行,也不支持写入日期类型(会报错),所以上面的代码做了预处理。另外,如果 xlsx 里有图片或图表,转换后会丢失。### 5. 批量转换与异常处理实际工作中经常要批量转换一堆文件。这里给一个带异常处理和进度提示的脚本,避免一个文件出错就中断:pythonimport osimport pandas as pddef batch_convert(folder_path, target_format='xlsx'): """ 批量转换文件夹中的所有 Excel 文件 :param folder_path: 文件夹路径 :param target_format: 目标格式,'xlsx' 或 'xls' """ for filename in os.listdir(folder_path): if not filename.endswith(('.xls', '.xlsx')): continue input_path = os.path.join(folder_path, filename) # 生成输出文件名(替换扩展名) base_name = os.path.splitext(filename)[0] output_path = os.path.join(folder_path, f"{base_name}.{target_format}") try: if target_format == 'xlsx': # 如果是 xls 转 xlsx df = pd.read_excel(input_path, engine='xlrd') df.to_excel(output_path, index=False, engine='openpyxl') else: # 如果是 xlsx 转 xls df = pd.read_excel(input_path, engine='openpyxl') if len(df) > 65535: print(f"跳过 {filename}: 行数超限") continue df.to_excel(output_path, index=False, engine='xlwt') print(f"成功: {filename} -> {output_path}") except Exception as e: print(f"失败: {filename} - 错误: {e}")# 使用示例if __name__ == "__main__": batch_convert("./excel_files", target_format='xls')### 6. 编码与特殊字符的坑中文文件名或内容里的特殊字符(如#?)在转换时可能导致编码错误。解决办法是统一使用utf-8编码,并处理文件名:pythonimport pandas as pd# 读取时指定编码(如果内容有乱码)df = pd.read_excel("中文数据.xls", engine='xlrd', encoding='utf-8-sig')# 写文件时确保路径无特殊字符output_path = "output/最终_数据.xlsx" # 避免使用 ? 等字符df.to_excel(output_path, index=False, engine='openpyxl')### 7. 总结xls 与 xlsx 转换的核心坑点在于:-引擎选择:读 xls 用xlrd,读 xlsx 用openpyxl,写 xls 用xlwt,写 xlsx 用openpyxl。混用会导致各种报错。-行数限制:xls 最多 65536 行,超出必须分割或改用 xlsx。-数据类型:日期、布尔值等在转换时可能丢失或报错,建议预处理为字符串。-功能丢失:合并单元格、宏、图表等不会被pandas保留,需要更专业的库(如pyexcel或直接操作 XML)。-批量处理:务必用 try-except 包裹,避免一个坏文件卡死整个流程。掌握了这些,你就能在 xls 和 xlsx 之间平滑切换,再也不用担心“文件打不开”或“数据变乱码”了。如果你有特殊需求(如保留格式),可以进一步研究xlwingswin32com调用 Excel 应用本身来转换,但那属于另一个话题了。