Python中如何读取Word中的图片

1,445次阅读

Python能够快速的编写、调试，用来提取各类软件中的图片再好不过了。今天小编就为大家带来在Python中提取Word图片的方法。

方法

需要批量的修改文件后缀名，并且解压之后将图片拷贝到需要存放的地方，然后将该文件夹清空留作下次的路径，并且将文件从zip改回docx即可。（注意：doc不支持这个方法，如果需要提取doc格式的图片，可以先转为docx,再提取即可）

具体实现

1.导入相关库

”’ =========================================== @author: renjiaxin @time: 2018/8/9 0009 10:00 =========================================== ”’ import zipfile import os import shutil

</pre>
 

2.定义函数

为了方便和其他函数调用，直接写了个函数完成这个功能，在这里，我们需要以下四个参数：
<ul style="list-style-type: disc;">
 	<li>word文档的路径</li>
 	<li>zip压缩文件的路径</li>
 	<li>临时解压的tmp路径</li>
 	<li>最后需要保存的store_path路径</li>
</ul>
def word2pic(path, zip_path, tmp_path, store_path):    ”’    :param path:源文件    :param zip_path:docx重命名为zip    :param tmp_path:中转图片文件夹    :param store_path:最后保存结果的文件夹（需要手动创建）    :return:    ”’
<pre class="brush:js;toolbar:false">

3.重命名word文件，将后缀名docx改为zip

# 将docx文件重命名为zip文件 os.rename(path, zip_path) # 进行解压 f = zipfile.ZipFile(zip_path, ‘r’) # 将图片提取并保存 for file in f.namelist(): f.extract(file, tmp_path) # 释放该zip文件 f.close()

</pre>
 

4.zip还原为docx文件，并获得图片的列表

 

# 将docx文件从zip还原为docx    os.rename(zip_path, path)    # 得到缓存文件夹中图片列表    pic = os.listdir(os.path.join(tmp_path, ‘word/media’))
<pre class="brush:js;toolbar:false">

5.将图片复制到需要保存的文件夹中

并且我们将文件的名字命名为word所在的路径

# 将图片复制到最终的文件夹中 for i in pic: # 根据word的路径生成图片的名称 new_name = path.replace(‘\\’, ‘_’) new_name = new_name.replace(‘:’, ”) + ‘_’ + i shutil.copy(os.path.join(tmp_path + ‘/word/media’, i), os.path.join(store_path, new_name))

</pre>
 

6.删除tmp缓冲文件夹中的文件，用以存储下一次的文件

 

# 删除缓冲文件夹中的文件，用以存储下一次的文件    for i in os.listdir(tmp_path):        # 如果是文件夹则删除        if os.path.isdir(os.path.join(tmp_path, i)):            shutil.rmtree(os.path.join(tmp_path, i))
<pre class="brush:js;toolbar:false">

7.运行程序

if __name__ == ‘__main__’: # 源文件 path = r’E:\dogcat\提取图片\log.docx’ # docx重命名为zip zip_path = r’E:\dogcat\提取图片\log.zip’ # 中转图片文件夹 tmp_path = r’E:\dogcat\提取图片\tmp’ # 最后保存结果的文件夹 store_path = r’E:\dogcat\提取图片\测试’ m = word2pic(path, zip_path, tmp_path, store_path)

</pre>
 

效果预览

源word

<img loading="lazy" class="aligncenter size-full wp-image-11214" src="https://www.python51.com/wp-content/uploads/2021/04/1603872410581861.png" width="974" height="503" srcset="https://www.python51.com/wp-content/uploads/2021/04/1603872410581861.png 974w, https://www.python51.com/wp-content/uploads/2021/04/1603872410581861-240x124.png 240w, https://www.python51.com/wp-content/uploads/2021/04/1603872410581861-400x207.png 400w, https://www.python51.com/wp-content/uploads/2021/04/1603872410581861-768x397.png 768w" sizes="(max-width: 974px) 100vw, 974px" />

提取的图片

<img loading="lazy" class="aligncenter size-full wp-image-11216" src="https://www.python51.com/wp-content/uploads/2021/04/1603872435764380.png" width="669" height="170" srcset="https://www.python51.com/wp-content/uploads/2021/04/1603872435764380.png 669w, https://www.python51.com/wp-content/uploads/2021/04/1603872435764380-240x61.png 240w, https://www.python51.com/wp-content/uploads/2021/04/1603872435764380-400x102.png 400w" sizes="(max-width: 669px) 100vw, 669px" />

 

另附doc转docx

def doc2docx(doc_name, docx_name):    ”’    # doc转docx    :param doc_name: doc文档路径    :param docx_name: docx文档路径    :return:    ”’    try:        # 首先将doc转换成docx        word = client.Dispatch(“Word.Application”)        doc = word.Documents.Open(doc_name)        # 使用参数16表示将doc转换成docx        doc.SaveAs(docx_name, 16)        doc.Close()        word.Quit()    except:        pass
<pre class="brush:js;toolbar:false">

今天Python提取Word中图片的方法全部分享给大家啦，后面还有提取excel和pdf图片的方法，敬请期待。

神龙|纯净稳定代理IP免费测试>>>>>>>>天启|企业级代理IP免费测试>>>>>>>>IPIPGO|全球住宅代理IP免费测试

发表于：Python基础教程

2021-06-08

复制链接

赏

Python中如何读取Word中的图片

相关文章：

HTTP代理设置详解：一步步配置指南

什么是Socks5代理IP及其优势

Socks5代理配置教程及注意事项

什么是代理服务器IP：如何选择合适的

国外代理服务器的优势及选择建议

如何找到可靠的免费代理服务器

在线代理服务器的使用与推荐

HTTP代理服务器的设置及应用实例

静态代理IP怎么填写：步骤与示例

海外静态IP的代理选择与配置