基于依赖语法和词嵌入的句子改写器
项目描述
dependency-paraphraser
基于依赖解析和词嵌入相似性的句子改写器。
改写器的工作原理
- 创建依赖树的随机投影
- 用相似词替换几个词
基本用法(针对俄语)基于Natasha库
pip install dependency-paraphraser natasha
import dependency_paraphraser.natasha
import random
random.seed(42)
text = 'каждый охотник желает знать где сидит фазан'
for i in range(3):
print(dependency_paraphraser.natasha.paraphrase(text, tree_temperature=2))
# желает знать сидит фазан где каждый охотник
# каждый охотник желает знать где фазан сидит
# знать где фазан сидит каждый охотник желает
您可以为用相似词替换词提供自己的w2v模型
import compress_fasttext
small_model = compress_fasttext.models.CompressedFastTextKeyedVectors.load(
'https://github.com/avidale/compress-fasttext/releases/download/v0.0.1/ft_freqprune_100K_20K_pq_100.bin'
)
random.seed(42)
for i in range(3):
print(dependency_paraphraser.natasha.paraphrase(text, w2v=small_model, p_rep=0.8, min_sim=0.55))
# стремится каждый охотник знать рябчик где усаживается
# каждый охотник хочет узнать фазан где просиживает
# каждый охотник хочет узнать фазан где восседает
或者,您可以使用Natasha的w2v模型(也称为navec)进行扩展和使用
navec_model = dependency_paraphraser.natasha.emb.as_gensim
random.seed(42)
for i in range(3):
print(dependency_paraphraser.natasha.paraphrase(text, w2v=navec_model, p_rep=0.5, min_sim=0.55))
# желает каждый охотник помнить фазан где лежит
# каждый охотник желает знать фазан где сидит
# каждый охотник оставляет понять где фазан лежит
对于其他语言,使用此改写器的一种方法是使用UDPipe库
pip install dependency-paraphraser ufal.udpipe pyconll
import dependency_paraphraser.udpipe
path = 'english-ewt-ud-2.5-191206.udpipe'
pipe = dependency_paraphraser.udpipe.Model(path)
projector = dependency_paraphraser.udpipe.en_udpipe_projector
text = 'in April 2012 they released the videoclip for a new single entitled Giorgio Mastrota'
for i in range(3):
print(dependency_paraphraser.udpipe.paraphrase(text, pipe, projector=projector, tree_temperature=1))
# they released the videoclip in April 2012 for a new entitled Mastrota single Giorgio
# they released in April 2012 the videoclip for a entitled single new Giorgio Mastrota
# they released the videoclip in April 2012 for a new single Giorgio Mastrota entitled
投影器(将依赖树投影到平面句子的模型)可以针对任何语言进行训练,如果您有一个未标记的句子语料库和一个用于标记它们的语法解析器
import dependency_paraphraser.udpipe
import dependency_paraphraser.train_projector
parser = dependency_paraphraser.udpipe.Model(path_to_your_model)
sents = dependency_paraphraser.train_projector.label_udpipe_sentences(
texts=your_corpus,
model=parser,
)
projector = dependency_paraphraser.train_projector.train_projector(sents)
项目详情
下载文件
下载适用于您的平台的文件。如果您不确定选择哪个,请了解更多关于安装软件包的信息。
源分布
dependency-paraphraser-0.0.5.tar.gz (58.8 kB 查看哈希值)