這篇文章整理我在評估「雲端現有的相似性搜尋/向量資料庫服務」時的研究筆記,涵蓋 Amazon DocumentDB、Alibaba Cloud OpenSearch Vector Search Edition,以及 Amazon Neptune Analytics 的向量搜尋功能。如果你正在為 RAG 或推薦系統挑選託管式向量搜尋方案,這篇可以快速幫你掌握這三種服務的定位與適用場景。
為什麼要在雲端上做相似性搜尋?
把資料轉成向量嵌入(embedding)之後,就能用最近鄰搜尋找出語意相似的資料,這是 RAG、推薦系統、重複內容偵測的基礎。自己架一套向量資料庫要處理索引、擴展、備援與資料同步,因此我優先調查了幾個雲端已有的託管服務,看能否沿用既有資料庫直接加上向量搜尋能力。
Amazon DocumentDB 有哪些特點?
官方網頁:https://aws.amazon.com/tw/documentdb/
Amazon DocumentDB (with MongoDB compatibility) 是一種完全托管的 NoSQL 資料庫服務,可讓開發人員輕鬆地設置、操作和擴展 MongoDB 兼容的資料庫。它提供以下功能:
- MongoDB 兼容性:與 MongoDB 兼容,可以使用相同的工具、驅動程式和應用程式來管理和查詢資料。
- 完全託管:完全託管的服務,無需管理基礎架構。
- 可擴展性:可根據需要進行擴展,隨著資料增長而擴展資料庫。
- 高可用性:提供高可用性,資料始終可用。
- 安全性:提供多種安全功能,幫助保護資料。
Amazon DocumentDB 適用於各種應用,包括:
- 內容管理:可用於儲存和管理內容管理系統 (CMS) 的內容。
- 行動應用:可用於儲存和管理行動應用程式的資料。
- 即時大數據分析:可用於即時分析大數據。
Alibaba Cloud OpenSearch Vector Store 適合什麼場景?
官方介紹:OpenSearch Vector Search Edition 介紹
OpenSearch Vector Search Edition 是阿里巴巴集團開發的一款大規模分散式搜尋引擎,為整個集團提供搜尋服務,包括淘寶、天貓、菜鳥、優酷,以及為中國大陸以外地區客戶提供的其他電子商務平台。它也是阿里雲 OpenSearch 的基礎引擎。經過多年發展,已經滿足了高可用、高時效、性價比等業務需求,並提供自動化運維系統,可以根據業務特性構建自定義搜尋服務。
OpenSearch Vector Search Edition 的優勢:
| 優勢 | 說明 |
|---|---|
| 穩定性 Stability | 底層使用 C++ 開發,經過十餘年發展,為各類核心業務系統提供穩定的搜尋服務,適合對穩定性要求高的核心搜尋場景。 |
| 效率 Efficiency | 分散式搜尋引擎,允許檢索大量資料,支援即時資料更新,資料更新秒級即可生效,適合時間敏感的查詢和搜尋場景。 |
| 成本效益 Cost-effectiveness | 支援多種索引壓縮策略和多值索引載入測試,能夠經濟高效地滿足查詢需求。 |
Neptune Analytics 的向量搜尋有什麼不同?
Neptune Analytics 是 AWS 圖形資料庫 Neptune 的分析引擎,它把向量相似性搜尋直接整合進知識圖譜(graph)查詢中。以下是 Amazon 官方介紹影片的文字節錄:
您可以通過將資料形狀轉換為嵌入(即向量)來回答有關資料的複雜問題。使用向量搜尋索引可以回答有關資料的上下文及其與其他資料的相似性和連接的問題。
>
借助 Neptune Analytics 中的向量相似性搜尋,您可以輕鬆構建機器學習(ML)增強搜尋體驗和生成式人工智慧(GenAI)應用程式。它還提供了更低的總體擁有成本和更簡單的管理開銷,因為您不再需要管理單獨的資料儲存、構建管道或擔心保持資料儲存同步。您可以在 Neptune Analytics 中使用向量相似性搜尋,通過將針對特定域上下文的圖形查詢,與從 Amazon Bedrock 託管的 LLMs、GraphStorm 中的圖形神經網路(GNN)或其他來源導入的嵌入做低延遲、最近鄰相似性搜尋,進而增強您的 LLMs 功能。
>
例如,生物資訊學研究人員對將現有的血壓藥物重新用於其他可治療疾病感興趣,希望 在內部知識圖譜上使用向量相似性搜尋來找到蛋白質相互作用網路中的模式。或者一家大型線上圖書零售商可能需要使用已知的盜版材料來快速識別類似的媒體,並結合知識圖譜來識別欺騙性清單行為的模式並找到惡意賣家。
>
在這兩種情況下,在構建解決方案時,對知識圖譜進行向量搜尋可以提高準確性和速度,使用當今可用的工具減少了運營開銷和複雜性。
更多 API 參考:Neptune Analytics API Reference
這三種服務該怎麼選?
我的整理如下:
- 已經在用 MongoDB 相容的文件資料庫:優先考慮 Amazon DocumentDB,用熟悉的工具與驅動程式就能管理資料。
- 需要大規模、即時更新的搜尋場景(例如電商搜尋):OpenSearch Vector Search Edition 的秒級更新與分散式架構更合適。
- 資料本身是圖狀關係(知識圖譜),又想加語意搜尋:Neptune Analytics 直接在圖查詢中整合向量相似性搜尋,省去維護獨立向量資料庫與同步管道的成本。
延伸閱讀
- 雲端相似性搜尋資料庫研究:AWS DocDB、阿里雲 OpenSearch 與 Amazon Neptune 向量搜尋比較:同樣聚焦 向量資料庫、相似性搜尋,可接著比較不同情境的做法。
- 檢索增強生成(RAG)與 RETA-LLM 框架完整解析:同樣聚焦 RAG、向量資料庫,可接著比較不同情境的做法。
- 向量搜尋資料庫比較:RAG 系統該如何選擇 Vector Database:同樣聚焦 RAG,可接著比較不同情境的做法。
常見問題
Amazon DocumentDB 可以做向量搜尋嗎?
Amazon DocumentDB 本身定位是 MongoDB 相容的託管文件資料庫,主打完全託管、可擴展與高可用。若需要原生向量相似性搜尋,建議評估 Neptune Analytics 或專門的向量資料庫服務。
OpenSearch Vector Search Edition 最大的優勢是什麼?
它經過阿里巴巴十餘年電商核心搜尋場景的驗證,底層以 C++ 開發,穩定性高,支援秒級的即時資料更新。此外提供多種索引壓縮策略,能以較低成本滿足大規模查詢需求。
Neptune Analytics 的向量搜尋和一般向量資料庫有何不同?
它把向量相似性搜尋直接整合進知識圖譜,讓圖形查詢和向量最近鄰搜尋在同一個服務內完成。這樣不需要另外維護獨立的向量資料庫,也不用擔心兩套儲存之間的資料同步問題。
向量相似性搜尋通常用在哪裡?
常見應用包括 RAG 的語意檢索、推薦系統、重複內容或盜版媒體偵測,以及像論文中提到的藥物重定位——在蛋白質交互作用網路中找出相似模式。核心都是把資料轉成嵌入向量後做最近鄰搜尋。
參考資料
- Amazon DocumentDB 官方網頁
- OpenSearch Vector Search Edition 介紹(Alibaba Cloud)
- Neptune Analytics API Reference(AWS)
- Amazon Neptune Analytics 介紹影片
最後更新
2026-08-28(原文發布於 2024-07-24,本文保留原始筆記內容並補上 GEO 結構。)
關於作者 {#author}
Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。
首次發布:2024-07-24
