好东西,一个超过一百万条、约4400万个 GPT-4/3.5 token的、全新合成动漫主题文本数据集。#ai#
创建方式为:获取网络爬取的文本数据(不包含维基百科内容),将完整的网页文本通过支持长文本窗口的大型语言模型(GPT-4-32k/GPT-3.5-16K,根据难度动态切换),并合成一个精炼版本。
数据集页面:http://t.cn/A6YlqDR9
发布于 北京
好东西,一个超过一百万条、约4400万个 GPT-4/3.5 token的、全新合成动漫主题文本数据集。#ai#
创建方式为:获取网络爬取的文本数据(不包含维基百科内容),将完整的网页文本通过支持长文本窗口的大型语言模型(GPT-4-32k/GPT-3.5-16K,根据难度动态切换),并合成一个精炼版本。
数据集页面:http://t.cn/A6YlqDR9