Pythonでpython-docxを使用してdocx内の画像をバッチで抽出する

仕事で大量の docx ドキュメントから画像を抽出する必要があるため、インターネットで検索したところ、xml ファイルから分析して抽出したものが多く、複雑すぎました。実際には、もっと簡単な方法がありますが、python-docx にはこの機能が開発されていませんでしたが、リソース情報はデバッグ メソッドを通じて見つけることができ、直接抽出して保存するだけです。

この記事はオリジナルですので、転載する場合は出典を明記してください。

    for file in os.listdir(filePath):
        try:
            #跳过非docx文件
            if ".docx" not in file:
                continue
            # 创建imgPath
            subImgPath = imgPath + re.sub(".docx","",file)
            if not os.path.exists(subImgPath):
                os.makedirs(subImgPath)

            doc = docx.Document(filePath + file)        #打开文件
            for rel in doc.part._rels:
                rel = doc.part._rels[rel]               #获得资源
                if "image" not in rel.target_ref:
                    continue
                imgName = re.findall("/(.*)",rel.target_ref)[0]
                with open(subImgPath + "/" + imgName,"wb") as f:
                    f.write(rel.target_part.blob)
            UI.currentFile.setText("当前文件:" + imgName)
        except:
            continue
代码中subImagPath是为了按文件名创建目录而生成的一个变量。直接利用python-docx已解析xml结构,从中提出相关数据进行图片保存,此方法速度十分快,不用打开word,速度根据各位电脑情况而定,如果同时再结合多进程的话,感觉可以飞上天。

おすすめ

転載: blog.csdn.net/wudechun/article/details/101353852