台湾法律AI社群粉专「法律侦探」宣布开源「TW Legal RAG」台湾法律语义检索工具,将约2,200万笔台湾判决裁判结构化并向量化,用户可用日常口语搜索判决,并将结果打包成任何AI(ChatGPT、Claude、Gemini或本地模型)可直接读取的格式。工具内建引用验证功能,可检查AI回复中的判决字号是否真实存在。
背景:RAG与法律AI的痛点
RAG(检索增强生成)是目前解决大型语言模型(LLM)幻觉的主流技术架构,即在模型生成前先从外部知识库检索相关事实,确保输出有实际资料支撑。这在法律领域尤为关键,因LLM编造不存在的判例已多次引发实务争议,包括美国律师引用ChatGPT虚构判例被法院裁罚的知名案例。此工具旨在从源头防止此类问题。
工具架构:自带AI(BYO-AI)设计
TW Legal RAG采取独特的“自带AI”模式:工具本身不调用任何LLM,而是通过CLI工具对后端基础设施发出语义搜索请求,系统回传相关判决后,工具将结果打包成结构化Bundle,可直接喂给ChatGPT、Claude、Gemini或本地模型。用户无需本地部署嵌入模型或向量索引,依赖极轻量,仅需httpx、typer、rich三个Python套件,执行pip install twlegalrag即可使用。
工具提供四个核心指令:search(自然语言语义搜索)、pack(打包成AI可读Bundle)、check(引用验证,确认AI回复中引用的判决字号是否存在于Bundle中)、health(服务状态检查)。
引用验证:限制与亮点
引用验证功能通过纯正则表达式比对(不依赖LLM),检查AI生成内容中的判决字号是否真实存在于Bundle中。但开发者明确限制:验证器无法判断引述内容是否正确、无法侦测推理错误、也无法识别语义改写式幻觉,仅能确认字号的存在性。尽管如此,这已为法律AI应用提供重要基础保障。
免费开源背后的故事
开发者自述,这是一人独力完成的项目,历时半年投入上千小时优化检索��线,估算成本接近百万元新台币,但最终选择以MIT授权免费开源。原因之一在于看到台湾政府正推动各机关主动建置知识LLM服务,希望通过开源贡献力量。此举对台湾法律科技生态具有实质意义,开发团队可直接取用此工具集成应用,无需从零构建法律知识库。不过,工具会将用户查询记录在服务器端进行检索分析,但声明不用于模型训练。
目前真实使用体验仍有待司法相关工作人员反馈。

