使用 PHP 或 JavaScript 解析 pdf 表单以获取字段位置


Parsing pdf form using PHP or JavaScript to get field position

如何使用表单解析 Pdf 文件以获取它在 Web 服务器上的字段位置和页面 #?例如,有一些pdf的结构是这样的:

<</AcroForm 23 0 R/Metadata 2 0 R/Outlines 6 0 R/Pages 9 0 R/Type/Catalog>>
endobj
19 0 obj
<</DA(/ZaDb 0 Tf 0 g)/FT/Btn/Ff 49152/Kids[18 0 R 20 0 R]/T(Language)>>
endobj
23 0 obj
<</DA(/Helv 0 Tf 0 g )/DR<</Encoding<</PDFDocEncoding 26 0 R>>/Font<</Helv 22 0 R/ZaDb 35 0 R>>/XObject<</DSz 51 0 R>>>>/Fields[19 0 R 21 0 R 39 0 R 16 0 R 17 0 R 46 0 R 47 0 R 48 0 R]/SigFlags 1>>
endobj
25 0 obj
<</BBox[0.0 0.0 72.0 20.0]/FormType 1/Length 102/Matrix[1.0 0.0 0.0 1.0 0.0 0.0]/Resources<</Font<</Helv 22 0 R>>/ProcSet[/PDF/Text]>>/Subtype/Form/Type/XObject>>stream
1 g
0 0 72 20 re
f
/Tx BMC
q
2 1 68 18 re

如何使用 PHP 或 JavaScript 从此代码中获取字段位置?或者我可以尝试哪些库/实用程序?Pdftk 无法解决我的问题:(谢谢。

不幸的是,如果尝试像文本一样扫描PDF,我们将无法获得更多信息,因为它比我们想象的要复杂得多。

我通过Java的Itext PDF库解决了这个问题。看这里:

Itext 从现有 pdf 中获取字段坐标