
隨著大型語言模型(LLM)逐漸成為企業應用的核心技術,檢索增強生成(Retrieval-Augmented Generation,RAG)也成為許多 AI 系統不可或缺的架構。透過 RAG,模型可以在回答問題前先查詢外部知識,降低幻覺(Hallucination)並提高回答的準確性。然而,傳統 RAG 多半依賴向量資料庫進行相似度搜尋,當問題涉及多個人物、事件或關聯資訊時,往往難以理解資料之間的關係,影響最終回答品質。
LightRAG 是由香港大學資料密集型系統實驗室(HKU Data Intelligence Lab,HKUDS)推出的開源 RAG 框架,透過結合 知識圖譜(Knowledge Graph) 與 向量檢索(Vector Retrieval),讓大型語言模型不僅能找到相關內容,也能理解不同知識之間的關聯,進一步提升複雜問題的回答品質。相較於許多需要自行整合多套工具的 RAG 解決方案,LightRAG 更強調以輕量化的方式建立完整的知識檢索流程,同時兼顧效能與易用性。
LightRAG 的核心理念,是在文件匯入階段自動建立知識圖譜。系統會利用大型語言模型從文件中擷取人物、地點、組織、事件等實體,以及彼此之間的關聯,再將這些資訊建立成知識圖譜,同時保留向量索引。當使用者提出問題時,LightRAG 不僅會透過向量搜尋找到相關內容,也會利用知識圖譜探索實體間的連結,讓檢索結果更加完整。
例如,當詢問「某家公司曾與哪些企業合作,並有哪些共同投資的專案?」時,傳統 RAG 可能只能找到包含關鍵字的文件;而 LightRAG 則能沿著知識圖譜追蹤公司、合作夥伴與專案之間的關係,提供更具脈絡的回答。
從架構設計來看,LightRAG 主要包含以下幾個核心能力:
- 自動建立知識圖譜,擷取實體與關聯資訊。
- 結合向量搜尋與圖譜搜尋,提升檢索品質。
- 支援增量更新,不需重新建立整個知識庫。
- 提供簡潔 API,方便整合至各類 AI 應用。
- 相容多種大型語言模型與向量資料庫。
- 採用模組化架構,可依需求替換不同元件。
- 開源發布,可自行部署與客製化。
其中,增量更新(Incremental Update) 是 LightRAG 的一項重要特色。許多 RAG 系統在新增文件後,需要重新建立索引,甚至重新處理整個知識庫;LightRAG 則能只更新新增或修改的內容,同步調整知識圖譜與向量索引,降低維護成本,也更適合需要持續更新資料的企業環境。
另一項特色是 LightRAG 提供多種檢索模式。除了基本的向量搜尋之外,也支援以知識圖譜為核心的查詢,以及結合兩者的混合檢索(Hybrid Retrieval)。開發者可依據不同情境選擇最適合的方式,例如知識問答可採用混合模式,而文件摘要則偏重向量搜尋,提升整體系統的彈性。
相較於 LangChain、LlamaIndex 等偏向 AI 應用開發框架,LightRAG 更聚焦於 RAG 本身的檢索品質與知識管理。它並不是要取代既有框架,而是提供一套更完整的知識檢索架構,可與現有 AI Workflow 搭配使用。對於需要建立企業知識庫、內部文件搜尋、研究資料查詢或 AI 問答系統的團隊而言,LightRAG 提供了一種兼顧準確性與效能的實作方式。
整體而言,LightRAG 並非只是另一套 RAG 框架,而是重新思考知識檢索方式的開源解決方案。透過將知識圖譜與向量搜尋結合,它讓大型語言模型不僅能找到相關資訊,也能理解資料之間的關聯,進一步提升回答品質與推理能力。對於希望打造更準確、更容易維護且具備企業級擴充性的 RAG 系統而言,LightRAG 是近年相當值得關注的開源專案。