PDF格式由Adobe于1993年创建,因其在文档中的广泛应用而极受欢迎,但对人工智能系统来说却是一项挑战。尽管PDF文件是为人类阅读而设计的,但其复杂的结构,如列、图表和表格,使得自动分析变得困难。AI程序必须使用光学字符识别(OCR)技术来提取文本,但在处理复杂文档时会遇到困难。相比之下,HTML等格式由于有指示文档结构的标签,更易于分析。
PDF的限制影响了用户,他们在分析时遇到困难,也影响了AI公司,因为它们无法访问存储在非结构化格式中的大量数据。在这种背景下,像Factify这样的初创公司正在探索开发新格式,以结合PDF的优势并使AI分析更为简便。此外,Mistral公司正在开发基于AI的OCR系统,以改善PDF文档的阅读。尽管PDF仍然是主导标准,但随着人工智能变得越来越相关,对更友好的机器格式的需求也在增加。
PDF的限制影响了用户,他们在分析时遇到困难,也影响了AI公司,因为它们无法访问存储在非结构化格式中的大量数据。在这种背景下,像Factify这样的初创公司正在探索开发新格式,以结合PDF的优势并使AI分析更为简便。此外,Mistral公司正在开发基于AI的OCR系统,以改善PDF文档的阅读。尽管PDF仍然是主导标准,但随着人工智能变得越来越相关,对更友好的机器格式的需求也在增加。