Eksisozluk Dataset(一个更受欢迎的Reddit类网站,用于土耳其语)
站点描述
[Ekşi Sözlük] (https://eksisozluk.com/)是一个基于基于用户贡献而建立的网站概念的协作性超文本词典. 创立于1999年,可以认为是Reddit和"城市词典"的混合体.
这是土耳其语最受欢迎的互联网论坛。 [2022年的数据] (https://eksisozluk2023.com/entry/147008116)显示,该网站有3.63亿次独特的访问者,个人页面访问量超过80亿次,平均每天访问量约为350万次.
作为在线公共领域,Ekşi Sözlük不仅被上千人用来分享从科学主题到日常生活问题等各种主题的信息,而且还被作为一个虚拟的社会政治社区来传播有争议的政治内容并分享个人观点. 因此,讨论的主题从政治到科学和关系,无所不在。
创建数据集
□ 叶克西皮
有几个API可以爬行Eksisozluk数据,但根据我以前的经验eksipy看来是一个简单而有效的解决方案. 它可以方便地检索任何特定主题的每个用户条目。 人们可以创造出一个自动脚本来爬行到不同的话题中去,并且每隔如此频繁地创建出.parquet数据的快照. 也可以创造一份工作,它每天运行 爬行给一天的讨论 最新的数据。
总体而言,[开放-助理数据 (https://open-assistant.io/en/stats)的现状表明土耳其语的数据严重缺乏,我认为Eksisozluk将提供大量自然生成的数据,从严肃到随意不等。
数据集格式
每个 eksisozluk 线程包含一个话题(baslik)和每个用户在其下的一个条目(giri). 一般而言,每个用户每个专题都增加一个条目. 共同网站指南说"每个条目的结构都应该像一个字典条目(因此网站名的字面翻译为Eksi Sozluk = Sour Dictionary). 这理论上可以提供与虚拟助手的答案相匹配的更高质量的数据. 每个条目只有一等深(换句话说,每个条目下不能有回复),这简化了数据集的格式. eksisozluk的另一个好处是,每个用户内容的格式需要遵守某些指向线. 这个过程被调和,不遵守某些规则的条目被删除(注意这在过去受到主持人的更严格的规范. 如果数据的结构是一个问题,我们总是可以列入较老的条目,这些条目处于更温和的状态。
我看到你定义了若干个数据集类型。 我认为,Eksisozluk数据集的结构可以作为一个[仅文本]工作。 . . . . . . .
内容来源: LAION-AI/Open-Assistant