回到頂部
概念插畫:文件處理人員比對原始表格與拆散後的紙條,檢查重排是否保留欄列關係

Textract+Bedrock 讀 PDF:中文帳單與表格為何仍會錯?

AWS 新教學用 Textract 改善 Bedrock 文件問答,但不代表能直接處理繁體中文帳單。看懂支援格式、表格結構與模型重排風險,找出 PDF 答錯發生在哪一層。

內容查核: 來源查核:

如果 AI 把帳單的金額、日期讀錯,先查文件怎麼被轉成文字,不要急著升級聊天模型。 AWS 在 9 月 4 日發布 Textract 搭配 Bedrock 知識庫的教學,示範先解析複雜文件,再供 AI 查詢。這個思路值得參考,但台灣團隊不能把海外帳單範例直接當成繁體中文解法。

Textract 支援中文嗎?先過這一關

截至本次查核,官方限制文件列出的文字辨識語言是英文、法文、德文、義大利文、葡萄牙文與西班牙文,沒有中文。Queries 問答擷取也限定英文文件。

這不是把提示詞改成「請用繁體中文回答」就能補上的能力。後面的模型會說中文,不代表前面的辨識器能正確讀出台灣姓名、地址、品項與備註。早期新增語言的公告同樣以這些歐洲語言為範圍;這次新聞並未宣布新增中文。

我不建議拿繁中掃描帳單直接採用這個範例。 若公司主要處理英文供應商文件,可以評估;以繁中為主,應先找明列支援繁中的辨識方案,再用自己的文件驗證。本站的 PP-OCRv6 評估文章可作為另一條研究方向,不代表換過去就保證正確。

教學說能讀 Word,API 卻沒有:該信哪個?

新教學的格式段落列出 DOCX、HTML、XLSX 等類型,但 Textract 的 API 限制文件只列 JPEG、PNG、PDF、TIFF。官方範例程式庫的資料入口則寫明 PDF、PNG。

系統可以加入其他解析器或轉檔步驟,不等於 Textract 原生接受所有格式。 部署前要查的是實際程式如何處理副檔名、是否保留頁碼和表格,而不是只看教學的功能清單。

多頁文件還涉及呼叫方式。官方配額將同步 PDF 限制為單頁;多頁批次須評估非同步流程。檔案上傳成功,也不能證明每頁都完成辨識、寫入索引並可查詢。

表格抽出來了,為什麼答案還是錯?

Textract 本身有表格結構輸出。表格功能說明介紹了儲存格、標題、註腳與合計列等資訊。但服務能輸出結構,不代表你的程式保留了結構。

這次範例的架構文件說明:解析步驟取出 LINE 文字區塊,再交給 Nova Micro 重排成文字文件。不能因此假定儲存格之間的關係已完整傳到知識庫;模型整理文字也不是無損轉換。

假設一張測試帳單同時有「本期金額」與「前期欠款」,OCR 可能兩個數字都讀對,卻在重排時配錯欄位。答案讀起來通順,錯誤仍已發生。這是示意情境,不是本次部署測試結果。

問題出現的位置先拿什麼比對優先處理什麼
原檔有字,辨識結果缺字原頁與 OCR 輸出語言、影像品質、漏頁
文字正確,欄位配錯表格結構與重排文件標題、欄列、合計關係
文件正確,找來的段落不對檢索結果與文件版本切段、索引、條件篩選
證據正確,回答卻自行補數字回答與實際引用段落回答約束、計算、人工複核

這也是 RAG 檢索增強生成不能省略的除錯順序。先知道資訊在哪一步走樣,才知道該換 OCR、改檢索,還是檢查回答模型。

上線前,驗收「對得上」,不是「講得順」

我會先要求一組有人工答案的測試文件,涵蓋跨頁表格、合併欄位、中英混排與沒有答案的問題。保留原頁、辨識結果、重排版本與最後引用,並要求關鍵欄位能逐項核對;不能只展示一段漂亮摘要就算通過。

Bedrock 的 RAG 評估區分檢索與完整回答,也提供引用相關指標。不過其中以模型擔任評審的分數,不能取代帳號、日期與金額的人工標準答案。

需要更貼近業務的標準時,自訂評估指標可補上特定要求。我的建議是:文字解釋評估是否有依據;精確欄位另外做值比對,缺資料時接受拒答,而非獎勵模型湊出完整答案。

部署這個範例會產生雲端費用,包含儲存、運算、向量搜尋與模型呼叫,也會留下文件的衍生副本。評估時就要安排預算、存取權與清理方式;帳單中的個資也應先依公司的 AI 資料使用規範處理,不要直接拿客戶原檔做公開展示。

常見問題

Textract 可以直接辨識繁體中文帳單嗎?

繁體中文不在目前官方支援語言內。不要因為後端聊天模型能回答中文,就認定前面的文字辨識也支援;應先選合適的解析工具並驗證樣本。

把 Word 轉成 PDF,就能解決問題嗎?

轉檔只處理輸入格式,不會自動新增語言支援,也不保證表格結構完整。仍需檢查文字、欄位、頁碼與後續檢索是否正確。

已經做了 RAG,為什麼還會有幻覺?

RAG 只是讓模型取得外部資料。若辨識錯字、重排配錯欄位、檢索到舊版本,或回答沒有忠實使用證據,仍可能答錯。

參考來源

№ · further reading

延伸閱讀