1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
# -*- coding: utf-8 -*-
import zipfile, os, re, glob
 
tmp = r'C:\Users\jcxiong\AppData\Local\Temp\ta_e2e_524cecf1'
docs = r'C:\Users\jcxiong\Documents\Codex\MyProject\trafficAudit\docs'
 
def row_summary(path):
    zf = zipfile.ZipFile(path)
    xml = zf.read('xl/worksheets/sheet1.xml').decode('utf-8')
    dim = re.search(r'<dimension ref="([^"]+)"', xml)
    rows = re.findall(r'<row r="(\d+)"[^>]*?(/?)>', xml)
    empties = [r for r, selfclose in rows if selfclose]
    return dim.group(1) if dim else None, len(rows), empties
 
for gen_name, sample_name in [('gen_freight_rank.xlsx', '生成_货运量排名.xlsx'),
                              ('gen_turnover_rank.xlsx', '生成_周转量排名.xlsx')]:
    g = row_summary(os.path.join(tmp, gen_name))
    s = row_summary(glob.glob(os.path.join(docs, sample_name))[0])
    print(gen_name, '-> dim:', g[0], 'rows:', g[1], 'empty rows:', g[2][-5:])
    print(sample_name, '-> dim:', s[0], 'rows:', s[1], 'empty rows:', s[2][-5:])