UER-py
UER-py copied to clipboard
处理长文本的问题
在预处理阶段过长的文本是如何处理的呢,是直接截断了吗。目前想要做一个阅读理解的任务,但是需要针对自己的语料库进行增量预训练,语料库文档长度大多超过500,这是需要将文档分成子句再去做预处理比较好吗。