專業人員整理資料文件夾,象徵企業資料管理的重要性
Photo by Anete Lusina from Pexels

企業資料清理:RAG 系統成敗的關鍵環節

在企業導入私有 AI 應用的浪潮中,大家都在談 RAG(Retrieval-Augmented Generation)技術有多強大,但很少人討論一個更本質的問題: 你的資料夠乾淨嗎?

在我實際參與營造產業的 AI 應用過程中,我觀察到一個關鍵問題:營造業的技術資料很多都是投影片轉存的 PDF,這類資料的知識結構和完整性都很差,連帶就會影響後續 RAG 的資料取用,最終影響 AI 回答的正確性。

這個現象點出了企業 AI 應用中最容易被忽略,卻可能最致命的問題。

🎯 問題的本質:Garbage In, Garbage Out

核心事實

資料品質不是 RAG 系統的附加價值,而是決定系統能否正常運作的基礎設施。根據 2024 年的業界研究,低品質資料造成的 AI 系統失敗案例中,超過 70% 的問題可以追溯到資料前處理階段。

知識結構的破碎化

投影片本質上就是「精簡版」資訊,設計目的是輔助口頭報告,而非完整記錄知識。當這些投影片轉存為 PDF 後,問題會進一步惡化:

❌ 投影片的侷限

  • 僅保留關鍵字與要點
  • 缺乏完整的上下文說明
  • 圖表與文字脫節
  • 依賴口頭補充說明

✅ RAG 需要的資料

  • 完整的語句和段落
  • 清晰的邏輯結構
  • 圖文的關聯性
  • 獨立可理解的內容

營造產業的特殊挑戰

以營造產業為例,這個問題特別嚴重:

格式混亂

  • 掃描版 PDF(圖片形式)需要 OCR,辨識錯誤率高
  • 排版格式不統一,影響文本解析
  • 專業術語、編號系統(如 CNS 規範編號)容易被錯誤切割

知識完整性不足

  • 缺少施工背景、適用條件、注意事項等關鍵資訊
  • 「為什麼這樣做」的推理過程往往被省略
  • 僅有結論性的要點,沒有支持性的細節

多模態資訊斷裂

  • 施工照片與文字說明的關聯性難以保留
  • 工程圖說與施工步驟脫節
  • 規範標準的引用關係破碎
建築工程藍圖特寫,展示營造產業文件的複雜性
Photo by Ivan S from Pexels

🔗 對 RAG 系統的連鎖影響

資料品質問題會在 RAG 系統的每個環節被放大,形成惡性循環。

階段一:Embedding 失真

當文本品質低落時,向量嵌入(Embedding)就會產生低品質的語義表示:

破碎的文本 → 低品質向量 → 語義相似度計算失準 → 檢索失效

實際案例

假設有一段施工規範原本是:

「混凝土澆置前,應確保模板支撐系統穩固,鋼筋綁紮符合設計圖說,並完成預埋件安裝。環境溫度低於 5°C 時,應採取保溫措施。」

但投影片轉存後變成:

「澆置前檢查

  • 模板系統
  • 鋼筋
  • 預埋件 (溫度 <5°C → 保溫)」

第二種形式的 Embedding 品質會明顯較差,因為:

  • 失去了完整的語句結構
  • 遺失了「為什麼」的因果關係
  • 溫度條件的說明被簡化為符號

階段二:檢索錯誤

當用戶問「混凝土澆置時遇到低溫天氣該怎麼辦?」

低品質資料的檢索結果

  • 可能檢索到「模板系統」相關內容(因為在同一頁)
  • 可能完全遺漏「保溫措施」(因為被簡化為符號)
  • Top-K 結果充斥無關片段

高品質資料的檢索結果

  • 直接命中「環境溫度低於 5°C」條件
  • 完整提供「應採取保溫措施」的建議
  • 同時包含相關的背景說明

階段三:生成偏差

LLM 基於不完整的 Context 進行推理,後果嚴重:

⚠️ 幻覺問題加劇

當 AI 無法從檢索結果中找到完整資訊時,會更容易「編造」看似合理但實際錯誤的答案。

範例 :可能回答「低溫時應加快澆置速度」(錯誤),而非「採取保溫措施」(正確)。

💡 實務解決方案

面對資料品質問題,我們需要短期與中長期並行的策略。

短期策略:快速改善

1. 資料分級處理

不是所有文件都需要完美,建立優先順序:

🟢 Tier 1

高品質文件

完整的技術規範、標準文件

→ 優先建立索引

🟡 Tier 2

中品質文件

投影片轉存的 PDF

→ 人工審核 + 補充

⚪ Tier 3

低品質文件

掃描文件、手寫筆記

→ 先存檔,後處理

2. Metadata 增強

為每份文件加上結構化的 Metadata:

{
"document_type": "施工規範",
"completeness_level": "完整",
"source_context": {
"original_format": "PowerPoint",
"presenter": "王工程師",
"presentation_date": "2024-03-15",
"topic": "混凝土施工品質管制"
},
"quality_score": 0.65,
"requires_enhancement": true
}

這些 Metadata 可以幫助 RAG 系統:

  • 優先使用高完整度的文件
  • 在回答時標註資訊來源的可靠度
  • 自動觸發人工審核流程

3. Chunk 策略優化

針對投影片類文件,使用「 頁面級 Chunk 」而非固定長度切割:

❌ 固定長度切割

可能在句子中間切斷,破壞語義完整性。特別是投影片,可能把標題和內容分開。

✅ 頁面級 Chunk

保留頁面內的所有元素(標題 + 內容 + 圖說),在 Metadata 中記錄前後頁面關聯。

中長期策略:系統性改善

1. 建立知識重構流程

不要期待原始資料完美,建立一套改善流程:

Mermaid Diagram

關鍵環節

  • 自動評分 :基於文本完整度、結構清晰度、引用可驗證性
  • 人工審核 :專家補充「為什麼」的推理過程、適用條件、注意事項
  • 版本控管 :保留改善歷史,持續優化

2. 多模態 RAG 架構

智慧型手機顯示 AI 聊天機器人介面,象徵 AI 技術的應用
Photo by Sanket Mishra from Pexels

營造業的資料往往需要「文字 + 圖表 + 施工照片」的多模態整合:

技術方案

  • 使用 CLIP 等模型處理圖表和照片
  • 建立「文字-圖像」的關聯索引
  • 檢索時同時返回文字說明和相關圖像
  • LLM 能夠理解並整合多模態資訊

實際效益 : 當用戶問「鋼筋綁紮的正確方式」時,系統能同時提供:

  • 📄 文字說明(步驟、規範、注意事項)
  • 📷 施工照片(正確示範)
  • 📊 工程圖說(細部節點)

3. 主動式知識管理

讓 AI 系統參與資料品質改善:

💡 智慧反饋機制

  1. AI 發現知識片段不完整時,自動標記為「待補充」
  2. 追蹤「高頻但低滿意度」的查詢,優先改善相關文件
  3. 建立專家審核機制,定期補充關鍵資訊
  4. 監控生成品質,反向優化資料處理流程

4. 採用 Document Intelligence

現代化的文件解析工具能大幅提升處理品質:

工具類型 代表產品 核心能力 適用場景
開源解決方案 Docling (IBM)、Unstructured.io 保留文件結構的高品質轉換 預算有限、需要客製化
雲端服務 Azure Document Intelligence、AWS Textract 強大的 OCR 與版面分析 大規模處理、需要高準確度
專業解析 LlamaParse (LlamaIndex) 針對 RAG 優化的解析 RAG 系統專用

選擇建議

  • 預算充足 + 資料敏感度低 → Azure/AWS 雲端服務
  • 預算有限 + 需要掌控度 → Docling/Unstructured.io
  • 已使用 LlamaIndex → LlamaParse(最佳整合)

🎯 80/20 法則:實務建議

根據我的經驗和業界實踐,面對龐大的歷史資料,「完美主義」往往是失敗的開始。

識別 20% 的核心文件

🎯 高價值文件識別標準

📈 使用頻率

被查詢次數 Top 20% 的主題

⚠️ 風險等級

涉及安全、品質、法規的內容

🔄 更新頻率

規範標準、常用工法

💡 知識密度

包含核心技術與關鍵判斷

行動方案

  1. 第 1 個月 :識別並清理 20% 核心文件
  2. 第 2-3 個月 :建立高品質的「黃金資料集」並上線測試
  3. 第 4 個月起 :根據使用反饋,逐步擴充資料集

其餘 80% 的文件:接受不完美

對於剩餘的文件:

  • ✅ 使用自動化工具做初步處理
  • ✅ 透過使用反饋逐步改善(而非事前完美)
  • ✅ 在回答時標註資訊來源的可靠度
  • ✅ 建立「待改善文件清單」,依優先順序處理

建立持續改善循環

部署 70 分系統 → 收集使用反饋 → 識別問題資料 → 優先改善 → 重新部署 90 分系統

關鍵指標

  • 問答準確率(目標:從 70% 提升至 90%)
  • 資料涵蓋率(目標:核心主題 100% 覆蓋)
  • 用戶滿意度(目標:「有幫助」比例 > 85%)
  • 幻覺率(目標:< 5%)

💡 核心理念

完美是優秀的敵人。 不要等資料 100% 清理完才上線,而是先上線一個「70 分的系統」,然後透過實際使用快速迭代到 90 分。

📊 成功案例參考

根據 2024 年業界研究報告,採用系統化資料清理策略的企業 RAG 系統:

改善項目 改善前 改善後 提升幅度
問答準確率 62% 89% +43%
首次檢索命中率 45% 78% +73%
幻覺問題發生率 18% 4% -78%
用戶滿意度 3.2/5 4.5/5 +41%

資料來源:IBM Research (2024), "The Cost of Poor Data Quality in Enterprise AI"

結語

企業資料清理不是一個「做完就好」的專案,而是一個需要持續經營的系統工程。

在這個過程中,最重要的不是追求完美,而是:

  1. 正視問題 :承認現有資料的品質問題
  2. 分級處理 :先解決 20% 的核心問題
  3. 持續改善 :透過使用反饋不斷優化
  4. 技術賦能 :善用現代化工具提升效率

當營造業的工程師能夠問 AI「混凝土低溫施工的注意事項」,並得到準確、完整且可信賴的回答時,那才是企業 AI 應用真正落地的時刻。

而這一切,都始於對資料品質的重視。


資料來源

外部資料

  1. The Rise and Evolution of RAG in 2024: A Year in Review - RAGFlow

    • RAG 技術在 2024 年的發展趨勢,強調資料清理的重要性
  2. Why Data Quality Makes or Breaks Your Enterprise RAG System - Nstarx Inc

    • 企業 RAG 系統中資料品質的關鍵影響,引用 IBM Research 2024 研究
  3. Essential Data Preprocessing for Any RAG System - Unstructured.io

    • RAG 系統的資料前處理最佳實踐
  4. Taming the Enterprise Data Beast: Making Your Data RAG-Ready - LinkedIn

    • 企業資料清理與預處理的實務建議
  5. Best Practices for RAG Pipelines - Medium

    • RAG 流程的最佳實踐與 Chunking 策略

本地知識庫

  • 個人在企業 AI 應用領域的實務經驗