2012-02-15 3 views
1

Я пытаюсь использовать pyPdf для извлечения нескольких страниц из большого pdf-файла в отдельный файл. Всякий раз, когда я это делаю, результирующий файл почти идентичен исходному файлу. Я думаю, что это имеет какое-то отношение к закладкам внутри файлов, потому что размер выходного файла очень мал, если страница не содержит ссылок. Я не могу понять, как исключить закладки из выходного файла.Файлы вывода pyPdf имеют одинаковый размер независимо от количества страниц

from pyPdf import PdfFileWriter as writer, PdfFileReader as reader 
w = writer() 
r = reader(open('9.pdf')) 

for p in xrange(5): 
    w.addPage(r.getPage(p)) 
with open('out.pdf', 'wb') as stream: 
    w.write(stream) 

w._objects 
# prints: 

{'/Kids': [IndirectObject(4, 0), IndirectObject(5, 0), IndirectObject(6, 0), IndirectObject(7, 0), IndirectObject(8, 0)], '/Type': '/Pages', '/Count': 5} 
{'/Producer': u'Python PDF Library - http://pybrary.net/pyPdf/'} 
{'/Type': '/Catalog', '/Pages': IndirectObject(1, 0)} 
{'/Parent': IndirectObject(1, 0), '/Rotate': 0, '/Contents': IndirectObject(4307, 0), '/Resources': {'/ColorSpace': {'/CS1': IndirectObject(4309, 0), '/CS0': IndirectObject(4305, 0)}, '/XObject': {'/Im0': IndirectObject(4312, 0)}, '/ExtGState': {'/GS2': IndirectObject(4324, 0), '/GS1': IndirectObject(4323, 0), '/GS0': IndirectObject(4306, 0)}, '/Font': {'/T1_2': IndirectObject(4308, 0), '/T1_0': IndirectObject(4303, 0), '/T1_1': IndirectObject(4304, 0)}, '/ProcSet': ['/PDF', '/Text', '/ImageB']}, '/CropBox': [0, 0, 612, 792], '/BCLPrivAnnots': {'/BCLC_BCL_Jade': []}, '/MediaBox': [0, 0, 612, 792], '/Annots': IndirectObject(4301, 0), '/Type': '/Page'} 
{'/Parent': IndirectObject(1, 0), '/Contents': IndirectObject(2, 0), '/Resources': {'/ColorSpace': {'/CS1': IndirectObject(4309, 0), '/CS0': IndirectObject(4305, 0)}, '/ExtGState': {'/GS2': IndirectObject(3417, 0), '/GS1': IndirectObject(3412, 0), '/GS0': IndirectObject(4306, 0)}, '/Font': {'/T1_2': IndirectObject(3413, 0), '/T1_0': IndirectObject(3415, 0), '/T1_1': IndirectObject(3416, 0)}, '/ProcSet': ['/PDF', '/Text']}, '/Rotate': 0, '/CropBox': [0, 0, 612, 792], '/BCLPrivAnnots': {'/BCLC_BCL_Jade': []}, '/MediaBox': [0, 0, 612, 792], '/Thumb': IndirectObject(3920, 0), '/Type': '/Page'} 
{'/Parent': IndirectObject(1, 0), '/Contents': IndirectObject(4, 0), '/Resources': {'/ColorSpace': {'/CS0': IndirectObject(4305, 0)}, '/ExtGState': {'/GS0': IndirectObject(4306, 0)}, '/Font': {'/T1_2': IndirectObject(3425, 0), '/T1_3': IndirectObject(3428, 0), '/T1_0': IndirectObject(3426, 0), '/T1_1': IndirectObject(3427, 0)}, '/ProcSet': ['/PDF', '/Text']}, '/Rotate': 0, '/CropBox': [0, 0, 612, 792], '/BCLPrivAnnots': {'/BCLC_BCL_Jade': []}, '/MediaBox': [0, 0, 612, 792], '/Thumb': IndirectObject(3921, 0), '/Type': '/Page'} 
{'/Parent': IndirectObject(1, 0), '/Contents': IndirectObject(6, 0), '/Resources': {}, '/Rotate': 0, '/CropBox': [0, 0, 612, 792], '/BCLPrivAnnots': {'/BCLC_BCL_Jade': []}, '/MediaBox': [0, 0, 612, 792], '/Thumb': IndirectObject(3922, 0), '/Type': '/Page'} 
{'/Parent': IndirectObject(1, 0), '/Contents': IndirectObject(9, 0), '/Resources': IndirectObject(8, 0), '/Rotate': 0, '/CropBox': [0, 0, 612, 792], '/BCLPrivAnnots': {'/BCLC_BCL_Jade': []}, '/MediaBox': [0, 0, 612, 792], '/Thumb': IndirectObject(3923, 0), '/Type': '/Page'} 
+1

Не забывайте, что pyPdf не сжимает вывод, в то время как вход используется, вероятно, сжат. –

ответ

-1

При использовании PyPdf выходной файл имеет полосатый почти весь формат.

В частности, заменить:

with open('out.pdf', 'wb') as stream: 
    w.write(stream) 

для:

stream = file('out.pdf', 'wb') 
w.write(stream) 
stream.close() 

затем посмотреть на конечный результат.

Это также хорошая практика, чтобы написать:

fin = open('9.pdf') 
r = reader(fin) 
fin.close() 

и нет:

r = reader(open('9.pdf')) 
+0

Как это лучше, чем использование 'with', которое всегда закрывает файл, даже когда генерируется исключение? –

+0

У меня был скрипт, который испортил файл PDF, используя 'with'. Лучше быть в безопасности. – user850498

+3

Но 'с' _is_ безопасная сторона. –