处理完成之后如图:
对于700篇的文献整理,每一篇要依次点开,寻找对应 “年份 期刊名称 文章题目” ;这个工作量显然是灾难, 且重复操作没有营养,想写一个程序自动完成。第一步:获取每一篇文献的相关信息。若用程序直接读取pdf文件,寻找信息是相当困难的,因为我的这700篇文献中“年份 期刊名称 文章题目”出现位置极不规律,可以说一篇一个样,随便贴两张图:
可以看出,*“年份 期刊名称 文章题目”*出现很不一样,无法通过一种固定的方法获取,在“哥们”的帮助之下,获得了一个神奇的软件:Zotero,下载链接(https://www.zotero.org/download/),把文章导入之后可以自动获得一系列信息,如图:
通过导入的操作,可以获得每一篇的相关信息,此软件可以将这些信息输出为.csv文件,如图:
第二步:从这里选择需要的信息,然后再通过python代码,就可以批量命名啦,源程序直接上:
import os,csv
path = "C:/Users/e2164\Desktop/2"+"/" #文献文件所在位置
new_name = csv.reader(open(r'C:\Users\e2164\Desktop\wenxin.csv', encoding='utf-8')) #导出的excel文件所在位置
New=[]
for i in new_name: #获取表格想要信息,我这里选择的是 “年份 期刊名称 文章题目“
name=i[0]+'-'+i[1]+'-'+i[2] #这是把这些信息整合在一起
New.append(name)
print('导入完成')
# 获取该目录下所有文件,存入列表中
f = os.listdir(path)
print(len(f))
print(f[0])
n = 0
i = 0
j = 1
for i in f:
# 设置旧文件名(就是路径+文件名)
oldname = f[n]
# 设置新文件名
newname = New[n]+'.pdf'
# 用os模块中的rename方法对文件改名
try:
os.rename(path+oldname, path+newname)
print(oldname, '======>', newname) #命名成功的
except:
os.rename(path + oldname, path + 'error'+str(j)+'.pdf')
print(j)
j += 1 #命名失败的
n += 1
注意:
1、有些文献的题目中含有“/ \ < > * ? : ”,这样的字符是不允许出现的,所以在表格中把这些符号预先替换掉,从而大大提高成功率。
2、excel文件中的文献排列顺序要和文献文件顺序排列一致,否则出现“张冠李戴”。