“恢复主题偏好”在代码里叫 hydratePreferences,“访问权限申请流程”在文档里写的是“账号授权与审批”。当你想在本地文件里找到这些东西,传统的关键词搜索往往一无所获——不是文件里没有,而是说法对不上。
这正是 zg(zvec-grep) 想解决的问题。这套面向人与 AI 的本地优先检索基础设施,在保留 ripgrep(rg) 精确、快速、穷尽匹配能力的基础上,加入了语义发现、相关性排序与上下文组织能力,让本地检索从“猜关键词”变成“理解意图”。目前 zg 已正式开源。
![]()
从关键词到意图,检索的进化
rg 凭借出色的性能,早已成为开发者和 AI 检索本地内容的基础工具。函数名、配置名、错误信息、文档原文——这些明确目标,rg 能快速给出可验证的结果。但当 AI 开始处理代码理解、故障定位、知识问答这类复杂任务,检索输入就从明确的符号变成了自然语言描述。
这类查询与代码或文档的实际表述往往缺乏直接的词汇对应。比如用户问“恢复主题偏好”,代码里可能定义的是 hydratePreferences;用户问“访问权限申请流程”,文档里可能写的是“账号授权与审批”。缺少准确关键词时,仅靠文本匹配容易漏掉相关内容;扩大搜索范围,又会产生大量没有相关性排序的结果。
为了定位信息,AI 往往需要多轮构造查询、执行搜索、读取文件,再从分散的文本匹配中整理上下文。这不仅增加了工具调用和响应时间,还消耗了大量 Token,甚至可能导致 AI 基于不完整的信息得出结论。
zg 是什么:一套完整的本地检索方案
zg 对代码、文档等本地内容进行提取、组织与索引,通过 CLI 与 MCP 提供语义检索、BM25、混合检索和 rg 精确匹配能力。它的核心设计目标是让分散在本地文件中的信息能被高效发现和准确定位,设计宗旨包括:
- 全流程检索:覆盖从模糊探索、相关性收敛到精确验证的完整过程,每个阶段都能采用适合的检索方式,减少关键词猜测与结果遗漏
- 多文件格式支持:面向代码、文档与结构化数据,采用可扩展的内容提取机制,尽可能保留符号、标题、层级与元数据
- 上下文高效:对多路检索结果进行融合、排序并按需提供预览,同时保留来源与位置,减少无关内容带来的 Token 消耗
- 本地优先:文件扫描、索引与本地 Embedding 默认在设备内完成,远程内容传输必须经过显式授权
三步上手,人与 AI 即刻可用
zg 支持 macOS、Linux 和 Windows,面向开发者提供 CLI,面向 AI 提供 MCP。无需手工部署服务或编写集成配置,zg install 即可自动发现 Codex、Claude Code、Cursor 和 OpenCode,完成 MCP 配置。
从安装到开始检索只需三步:
- 安装:npm install -g @zvec/zvec-grep,然后运行 zg install 自动配置 MCP
- 建立索引:在仓库目录运行 zg index,默认使用轻量本地模型 local/potion-code-16m-v2
- 开始检索:通过 CLI 运行 zg query --human,或在已连接的 AI 中直接提问
同一份本地索引可由已连接的 AI 通过 MCP 直接使用,无需重复构建和配置。
多种搜索、多类内容,一个入口
复杂检索往往不是一次搜索就能完成。AI 从任务描述出发,在探索过程中逐步获得相关方向、关键词和明确目标。zg 提供语义检索、BM25、混合检索与 rg,让不同阶段都能采用适合的检索能力——这不是简单的工具叠加,而是一条从模糊到精确的完整检索路径。
在内容覆盖上,zg 面向代码、文档与结构化数据等多类文件格式,采用可扩展的内容提取机制,尽可能保留符号、标题、层级与元数据。这意味着更多本地文件能转化为结构清晰、可准确定位的检索内容,持续拓展可检索的信息边界。
本地运行,数据不出设备
zg 默认在设备内完成文件扫描、索引与本地 Embedding,远程内容传输必须经过显式授权。在保障隐私的同时,让用户始终掌握数据流向。对于重视数据安全和个人隐私的场景,这一点尤为关键。
zg 现已开源,支持 macOS、Linux 和 Windows,欢迎体验,也期待你的反馈与贡献。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.