關於系統 About
CNIRS (Chinese News Intelligent Retrieval System) 是一個針對中文新聞的智能檢索系統,整合了多種資訊檢索技術與模型。
本系統為 LIS5033 - Automatic Classification and Indexing 課程的期末專案,實作了從資料收集、預處理、索引建構到檢索評估的完整流程。
原理: 精確匹配查詢詞,支援 AND/OR 運算
優點: 快速、可預測、適合精確查詢
缺點: 無排序、結果數量難以控制
原理: 基於詞頻-逆文檔頻率,使用餘弦相似度排序
優點: 簡單有效、可解釋性強
缺點: 無法處理同義詞、語義理解有限
評估結果: MAP=0.3581, nDCG=0.4012
原理: 基於機率理論,考慮文檔長度正規化
優點: 業界標準、效能優異、速度快
缺點: 仍無法理解語義
評估結果: MAP=0.3708, nDCG=0.4064 (最佳)
原理: 使用預訓練語言模型編碼文本語義
優點: 深層語義理解、處理同義詞與語義相似
缺點: 計算量大、小資料集表現較差
評估結果: MAP=0.1586, nDCG=0.2306
Introduction to Information Retrieval - Christopher D. Manning, Prabhakar Raghavan, and Hinrich Schütze
Stanford University, Cambridge University Press, 2008
National Taiwan University
LIS5033 - Automatic Classification and Indexing
2025 Fall Semester