OpenAlex 學術研究智能平台 (RAG)
結合混合檢索、引用接地 RAG 與可視化資料旅程的學術研究智能平台。
以 38,152 篇 OpenAlex 論文為語料的全端研究平台。結合 BM25 + 密集向量檢索並以 Reciprocal Rank Fusion 融合排序、引用接地的串流 RAG(每個論點都連回 [Wxxxx] 來源)、文獻計量分析(主題趨勢、概念共現網路、UMAP 聚類、期刊、研究熱度、引用網路、作者/機構)、可視化的「資料旅程」、自動觸發的導覽小幫手,以及完整的中英文介面。
已驗證 Demo 錄影 1
由 portfolio quality pass 從既有專案 demo 素材複製。
媒體總覽
快速瀏覽這個專案的截圖與錄影展示。
專案連結與 Demo 狀態
專案概覽
OpenAlex 研究智能平台不只是一個搜尋框 — 它把 3.8 萬篇學術語料變成可解釋、可互動的研究平台。 使用者可以做混合搜尋(BM25 + 密集向量以 RRF 融合)並即時 facet 篩選,提出研究問題並得到引用接地的答案(每個論點都連回來源論文),並探索文獻計量分析:主題趨勢、概念共現網路、概念×年份熱度圖、論文的 UMAP 語意聚類、期刊排名、研究熱度、可點擊的引用網路,以及作者/機構瀏覽。 可解釋性的核心是「資料旅程」:選 sample(或上傳你的論文),看一筆查詢走過七個階段 — 原始 OpenAlex JSON、文字清理、BM25、向量嵌入、RRF 融合、RAG context 組裝、引用接地答案 — 每步都有動畫與「做什麼/效果/為什麼」解說,最後再附旅程總覽(延遲分解與候選漏斗)。 App 式導覽小幫手會自動開始,跨頁聚光每個功能、搭配漂浮粒子與逐字解說,整個介面可在繁體中文與英文間切換。所有功能皆以 Playwright 截圖與錄影驗證,本頁連結即為該錄影。
我的角色
獨立開發者 / 全端與檢索/RAG 系統架構師
問題背景
學術後設資料龐大且不透明。目標是做出一個可解釋、可展示的系統,讓任何人都能搜尋、提出有依據的問題,並親眼看見原始資料如何流經檢索 + RAG pipeline,而不只是看到最終數字。
解決方案
我以 DuckDB + ChromaDB + BM25 打造 FastAPI 後端,實作混合(RRF)檢索器與引用接地的 RAG pipeline(llama.cpp,並有萃取式 fallback);前端用 React + Recharts + framer-motion 做豐富視覺化、自動觸發的導覽小幫手,以及把一筆查詢動畫化走過 7 個 pipeline 階段並逐步解說的「資料旅程」,再加上完整 i18n。所有功能皆以 Playwright 自動截圖 + 錄影驗證。
目前成果
一個面試就緒的平台:混合 + RAG 搜尋且引用可點、四種主題分析視圖、引用網路、作者/機構瀏覽、搜尋日誌可觀測性、可解釋的 pipeline 旅程、導覽小幫手與雙語介面,全部端對端錄製完成。
作品亮點
- 混合檢索:BM25(rank_bm25)+ all-MiniLM-L6-v2 密集向量,以 RRF 融合;可即時依年份、期刊、類型、語言、引用數做 facet 篩選。
- 引用接地 RAG:SSE 串流答案,每個論點附可點擊的 [Wxxxx] 引用;問題建構器 + 預設題;無 LLM 時退化為萃取式。
- 資料旅程:上傳你的論文或用 sample,看一筆查詢走過 7 個動畫化 pipeline 階段,每步都有「做什麼/效果/為什麼」解說與旅程總覽。
- 分析:主題趨勢、概念共現網路、概念×年份熱度圖、UMAP 語意聚類、期刊排名、研究熱度、引用網路、作者/機構瀏覽、搜尋日誌分析。
- App 式導覽小幫手自動觸發、跨頁聚光每個功能、逐字解說並播放主題粒子;完整中英文切換。
技術挑戰
- 設計混合檢索器與引用接地 RAG pipeline,並在 LLM 離線時優雅退化為萃取式。
- 用記憶體 TTL 快取與預熱讓沉重的分析(UMAP 聚類、共現圖、熱度)感覺即時。
- 把數百個 UI 字串外部化成完整中英 i18n,同時保留專有名詞為英文。
- 用 Playwright 自動化驗證約 18 個頁面與導覽小幫手(視窗截圖 + 完整走訪錄影)。
目標使用者
- 作品集審閱者與面試官
- 需要快速理解專案目的、技術棧與成熟度的技術讀者
技術亮點
- 偵測到的主要技術線索:Python, FastAPI, React, Vite, Tailwind CSS, DuckDB, ChromaDB, BM25, sentence-transformers, RAG, llama.cpp, Recharts, Playwright
- 已有 README 作為後續補齊案例研究的依據
- 已連接公開 GitHub repository,可從作品集追溯原始碼
系統架構
此專案目前由 portfolio catalog pipeline 依 README、Git metadata、package/build 設定與素材線索建立案例頁。正式架構說明仍需依實際 source code 補齊;目前可確認的技術線索包含:Python, FastAPI, React, Vite, Tailwind CSS, DuckDB, ChromaDB, BM25, sentence-transformers, RAG, llama.cpp, Recharts, Playwright。
資料流程
目前尚未完成可公開的資料流程說明。若此專案含資料處理、AI pipeline 或後端 API,後續應補上 input、processing、storage、UI/output 的端到端流程。
專案結構
openalex-research-rag/ README.md # project documentation, when available source files # implementation reviewed by local audit package/build config # detected capability signals
安裝與執行
This project does not expose a verified runnable web command yet. Review the README/source tree and add exact install, run, test, and build commands before interview use. No verified build command was detected. Treat the current portfolio page as a case-study placeholder until build steps are reviewed.
後續改進
- 補齊正式 README、截圖與 demo recording
- 補上架構圖、資料流程與關鍵技術決策
- 確認 build/test 狀態並更新 portfolio release report
面試說明重點
- 先說明此專案目前的成熟度與可展示範圍
- 聚焦在可驗證的技術棧、程式結構與已完成部分
- 不要宣稱尚未部署、尚未錄影或尚未測試的能力已完成
後續規劃
- 把語料擴充到 10 萬篇以上,並以 qrels 評估檢索品質。
- 新增 multi-hop RAG 與重排序作為可選的生產設定。
- 把後端部署到 portfolio 後方,並以反向通道連回本機 llama.cpp。