TokuDB分形树 TokuDB 是 Tokutek 公司(后被 Percona 收购)开发的一款高性能、高压缩比的 MySQL 存储引擎,它的核心创新在于使用了分形树(Fractal Tree,具体来说是带缓冲的树,C... wen 2026-07-02 34
跳表在内存索引 高性能数据结构的核心原理与实战解析📖 目录导读跳表的基本概念与背景跳表在内存索引中的核心优势跳表的工作原理与数据结构详解跳表与平衡树、哈希表的对比分析跳表在主流系统中的应用案例跳表的性能优化与工程实践... wen 2026-07-02 33
Elasticsearch分片 Elasticsearch 的分片,这是一个非常核心且关键的概念,分片是 Elasticsearch 将索引数据分布到集群中多个节点上的基本单元,可以把一个索引想象成一个巨大的数据库表,当这个表的数据... wen 2026-07-02 33
倒排索引全文搜索 这是一个关于倒排索引与全文搜索的全面解析,倒排索引是现代搜索引擎(如 Elasticsearch、Lucene、Solr)的核心数据结构,负责实现海量文本的毫秒级检索,什么是倒排索引?核心思想:从“文... wen 2026-07-02 33
Solr与ES对比 这是一个非常经典的问题,Apache Solr 和 Elasticsearch(ES)都是基于 Apache Lucene 构建的顶级开源搜索服务器,由于它们核心是相同的,很多基础功能(如分词、倒排索... wen 2026-07-02 33
向量索引相似度 向量索引相似度是向量数据库和检索增强生成(RAG)系统的核心概念,它衡量的是两个向量在数学空间中的接近程度,以下是关于向量索引相似度的全面解析,包括核心概念、主流度量方法、索引原理及实际应用,为什么需... wen 2026-07-02 34
FAISS内存占用 FAISS(Facebook AI Similarity Search)的内存占用取决于多个因素,包括索引类型、数据维度、数据量以及是否压缩,以下是详细的分析和估算方法,核心内存计算公式基础内存模型对... wen 2026-07-02 34
HNSW图索引 HNSW(Hierarchical Navigable Small World) 是一种目前最流行、性能最顶尖的近似最近邻搜索(ANNS)算法之一,它被广泛应用于需要快速向量检索的场景,向量数据库(M... wen 2026-07-02 35
倒排与向量混合 这是一个非常专业且重要的信息检索(IR)话题,倒排索引和向量检索的混合检索(Hybrid Search)是目前构建高质量搜索引擎和RAG系统的核心策略,下面我会从定义、优缺点、混合的必要性以及具体实现... wen 2026-07-02 31
乘积量化压缩 乘积量化是一种高效的高维向量压缩技术,广泛应用于近似最近邻搜索和推荐系统等领域,它的核心思想是:将高维向量空间分解为多个低维子空间的笛卡尔积,然后在每个子空间中独立地进行量化,为什么选择PQ:它有效解... wen 2026-07-02 31