1. BERTopic需要安装的语言模型 第一次选用BERTopic模型执行主题聚类的时候,往往会看到这个错误提示:
这说明BERTopic需要安装SBERT语言模型,而且中文和英文是两个不同的模型,都要安装。因为GooSeeker分词工具没有采用双语模型,而是中文英文采用各自不同的模型,以便达到更好的效果。目前,我们选用这两个模型:
都是小规模的大语言模型。未来版本会支持用户自行选用语言模型。其实,在主题聚类任务中,主要用在字词向量化上,这种小规模模型足够用了。 2. 下载语言模型 所需的语言模型都在集搜客官方QQ群的文件夹中,如下图是文件夹位置: 进入这个群文件夹可以看到很多文件,末尾都有顺序编号。如下图: 其实,只有两个语言模型文件,由于模型太大,压缩的时候做了分卷处理,编号就是卷号。解压的时候,解第一个就行了,解压软件会把所有的卷读进来,解出来一个完整的模型。 解压完成后要把这个模型拷贝到前面提示框要求的目录中。拷贝过程一个很关键的注意点是拷对目录,目录层数一定要对。请参考《为集搜客分词和情感分析扩展模块安装情感分析模型库的方法》,SBERT模型和情感分析模型的安装方法是一样的。 |