为BERTopic安装需要的预训练SBERT模型

2026-7-15 17:07| 发布者: Fuller| 查看: 436| 评论: 0

摘要: BERTopic需要安装SBERT语言模型,而且中文和英文是两个不同的模型,都要安装。因为GooSeeker分词工具没有采用双语模型,而是中文英文采用各自不同的模型 ...

1. BERTopic需要安装的语言模型

第一次选用BERTopic模型执行主题聚类的时候,往往会看到这个错误提示:

在C:\Users\xxx\GooSeekerTag\models 下没有发现SBERT英文模型all-MiniLM-L6-v2,请把模型下载到该目录。或者询问管理员获取模型文件。

这说明BERTopic需要安装SBERT语言模型,而且中文和英文是两个不同的模型,都要安装。因为GooSeeker分词工具没有采用双语模型,而是中文英文采用各自不同的模型,以便达到更好的效果。目前,我们选用这两个模型:

  • 英文:all-MiniLM-L6-v2
  • 中文:bge-base-zh-v1.5

都是小规模的大语言模型。未来版本会支持用户自行选用语言模型。其实,在主题聚类任务中,主要用在字词向量化上,这种小规模模型足够用了。

2. 下载语言模型

所需的语言模型都在集搜客官方QQ群的文件夹中,如下图是文件夹位置:

进入这个群文件夹可以看到很多文件,末尾都有顺序编号。如下图:

其实,只有两个语言模型文件,由于模型太大,压缩的时候做了分卷处理,编号就是卷号。解压的时候,解第一个就行了,解压软件会把所有的卷读进来,解出来一个完整的模型。

解压完成后要把这个模型拷贝到前面提示框要求的目录中。拷贝过程一个很关键的注意点是拷对目录,目录层数一定要对。请参考《为集搜客分词和情感分析扩展模块安装情感分析模型库的方法》,SBERT模型和情感分析模型的安装方法是一样的。


鲜花

握手

雷人

路过

鸡蛋

最新评论

GMT+8, 2026-8-9 15:49