解压缩文件而不创建临时文件
unzip file without creating temporary files
我从 AWS S3 下载一个 zip 文件并解压缩。解压缩后,所有文件都保存在 tmp/
文件夹中。
s3 = boto3.client('s3')
s3.download_file('testunzipping','DataPump_10000838.zip','/tmp/DataPump_10000838.zip')
with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
zip_ref.extractall('/tmp/')
lstNEW = zip_ref.namelist()
listNEW
的输出是这样的:
['DataPump_10000838/', '__MACOSX/._DataPump_10000838', 'DataPump_10000838/DockBooking', '__MACOSX/DataPump_10000838/._DockBooking', 'DataPump_10000838/LoadEquipment', '__MACOSX/DataPump_10000838/._LoadEquipment', ....]
LoadEquipment 和 DockBooking 是文件,但其余的不是。是否可以在不创建这些临时文件的情况下解压缩文件?或者我可以过滤掉真实文件吗?因为稍后,我需要使用正确的文件并将它们压缩。
$item_$unixepochtimestamp.csv.gz
我使用压缩功能吗?
要仅提取某些文件,您可以将列表传递给 extractall
:
with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
lstNEW = list(filter(lambda x: not x.startswith("__MACOSX/"), zip_ref.namelist()))
zip_ref.extractall('/tmp/', members=lstNEW)
这些文件不是临时文件,而是 macOS 在通常不支持的 zip 文件中表示资源分支的方式。
我从 AWS S3 下载一个 zip 文件并解压缩。解压缩后,所有文件都保存在 tmp/
文件夹中。
s3 = boto3.client('s3')
s3.download_file('testunzipping','DataPump_10000838.zip','/tmp/DataPump_10000838.zip')
with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
zip_ref.extractall('/tmp/')
lstNEW = zip_ref.namelist()
listNEW
的输出是这样的:
['DataPump_10000838/', '__MACOSX/._DataPump_10000838', 'DataPump_10000838/DockBooking', '__MACOSX/DataPump_10000838/._DockBooking', 'DataPump_10000838/LoadEquipment', '__MACOSX/DataPump_10000838/._LoadEquipment', ....]
LoadEquipment 和 DockBooking 是文件,但其余的不是。是否可以在不创建这些临时文件的情况下解压缩文件?或者我可以过滤掉真实文件吗?因为稍后,我需要使用正确的文件并将它们压缩。
$item_$unixepochtimestamp.csv.gz
我使用压缩功能吗?
要仅提取某些文件,您可以将列表传递给 extractall
:
with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
lstNEW = list(filter(lambda x: not x.startswith("__MACOSX/"), zip_ref.namelist()))
zip_ref.extractall('/tmp/', members=lstNEW)
这些文件不是临时文件,而是 macOS 在通常不支持的 zip 文件中表示资源分支的方式。