最近邻逼近搜索 - 代码天地

最近邻逼近搜索

其他 2021-01-28 23:55:00 阅读次数: 0

说明

由于业务中需要用到向量之间的相似索引，其实向量相思索引在很多的业务场景中都有非常高的应用价值。我们已经有把词、句子、图片、等信息处理成响亮的方法。这样在一些相关性检索方面就有了应用价值。

本文中搭建了annoy和nmslib两种方式。
下面提供了两种方式的的索引构建方式：

annoy索引构建：

f = 200
tc_index = AnnoyIndex(f,metric='angular')
with open(r"D:\sent_vec", "r", encoding="utf-8") as reader:

    for line in reader:

        line = line.strip()
        linespl = line.split()
        id = int(linespl[0])
        vec = [float(v) for v in linespl[1:]]

        tc_index.add_item(id, vec)

tc_index.build(5)

tc_index.save(r'D:\index.ann')

nmslib索引构建：

tc_index = nms.init(method='hnsw', space='cosinesimil')

with open(r"D:\sent_vec", "r", encoding="utf-8") as reader:

    for line in reader:

        line = line.strip()
        linespl = line.split()
        id = int(linespl[0])
        if id % 10000 == 0:
            print("processing {}".format(id))
        vec = [float(v) for v in linespl[1:]]
        if first_data == None:
            first_data = vec

        tc_index.addDataPoint(id, vec)

简评：
总体使用过程中，nmslib要稍微快一点，根据向量去检索索引，对未登录也比较友好。

猜你喜欢

转载自blog.csdn.net/cyinfi/article/details/102134979

最近邻逼近搜索

高维空间最近邻逼近搜索算法评测

Nmslib高维空间最近邻逼近搜索算法介绍

利用kd树实现最近邻搜索

基于KD-Tree的最近邻搜索

kd_tree搜索最近邻点

最近邻

kd树之最近邻的搜索Java实现

近似最近邻搜索ANN(Approximate Nearest Neighbor)

最近邻搜索:Product Quantization for Nearest Neighbor Search

Elasticsearch：在 Elastic Stack 8.0 中引入近似最近邻搜索

K近邻分类算法与kdTree实现的伪代码（构造kdTree 和 kdTree上搜索最近邻）

最近邻分类器

k最近邻

最近邻算法调研

最近邻相关推荐

TensorFlow的最近邻算法

最近邻方法

K最近邻（KNN）

最近邻模型

K最近邻算法

最近邻滤波法

K最近邻(KNN)

近似最近邻检索

一文尽览近似最近邻搜索中的哈希与量化方法

k-d树最近邻搜索算法原理与伪代码

最近邻搜索神器——一文读懂局部敏感哈希LSH原理

最近邻检索（NN）和近似最近邻（ANN）检索

sklearn.neighbors 最近邻

K最近邻算法（KNN）

今日推荐

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

国产云输入法——仅华为无云端数据上传安全问题

开源日报 | 工业开源项目OGG 1.0；姐姐，你要和我一起配置火狐吗；苹果AI遥遥落后？Fedora 40

开放签电子签章：停止新增，优化体验，前进更进（五一假期前工作）

开源日报 | 中学生开源前端动画引擎；全球首个Llama3 8B中文版开源模型；联想电脑恐出局；Linus讽刺AI炒作

周排行

浏览器对同一域名进行请求的最大并发连接数

React Hook之自定义Hook

【转】MyBatis缓存机制

-Java-泛型

自动化测试常用脚本-发送邮件

LeetCode#859: Buddy Strings

java、Python处理字符串

第二篇の博客

Hadoop伪分布式环境安装

SQL Server进阶（十一）临时表、表变量

每日归档

更多

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)

2024-04-20(6)

2024-04-19(5)

2024-04-18(0)