智能论文笔记

Detecing Anti-Vaccine Users on Twitter

Matheus Schmitz , Goran Murić , Keith Burghardt

分类：自然语言处理

2021-10-21

最近受到在线叙述驱动的疫苗犹豫会大大降低了疫苗接种策略的功效，例如Covid-19。尽管医学界对可用疫苗的安全性和有效性达成了广泛的共识，但许多社交媒体使用者仍被有关疫苗的虚假信息淹没，并且柔和或不愿意接种疫苗。这项研究的目的是通过开发能够自动识别负责传播反疫苗叙事的用户的系统来更好地理解反疫苗情绪。我们引入了一个公开可用的Python软件包，能够分析Twitter配置文件，以评估该个人资料将来分享反疫苗情绪的可能性。该软件包是使用文本嵌入方法，神经网络和自动数据集生成的，并接受了数百万条推文培训。我们发现，该模型可以准确地检测出抗疫苗用户，直到他们推文抗Vaccine主题标签或关键字。我们还展示了文本分析如何通过检测Twitter和常规用户之间的抗疫苗传播器之间的道德和情感差异来帮助我们理解反疫苗讨论的示例。我们的结果将帮助研究人员和政策制定者了解用户如何成为反疫苗感以及他们在Twitter上讨论的内容。政策制定者可以利用此信息进行更好的针对性的运动，以揭露有害的反疫苗接种神话。

translated by 谷歌翻译

What are People Talking about in #BlackLivesMatter and #StopAsianHate? Exploring and Categorizing Twitter Topics Emerging in Online Social Movements through the Latent Dirichlet Allocation Model

Xin Tong , Yixuan Li , Jiayi Li , Rongqi Bei , Luyao Zhang

分类：自然语言处理 | 机器学习

2022-05-29

少数群体一直在使用社交媒体来组织社会运动，从而产生深远的社会影响。黑人生活问题（BLM）和停止亚洲仇恨（SAH）是两个成功的社会运动，在Twitter上蔓延开来，促进了抗议活动和活动，反对种族主义，并提高公众对少数群体面临的其他社会挑战的认识。但是，以前的研究主要对与用户的推文或访谈进行了定性分析，这些推文或访谈可能无法全面和有效地代表所有推文。很少有研究以严格，量化和以数据为中心的方法探讨了BLM和SAH对话中的Twitter主题。因此，在这项研究中，我们采用了一种混合方法来全面分析BLM和SAH Twitter主题。我们实施了（1）潜在的DIRICHLET分配模型，以了解顶级高级单词和主题以及（2）开放编码分析，以确定整个推文中的特定主题。我们通过#BlackLivesMatter和#Stopasianhate主题标签收集了超过一百万条推文，并比较了它们的主题。我们的发现表明，这些推文在深度上讨论了各种有影响力的话题，社会正义，社会运动和情感情感都是两种运动的共同主题，尽管每个运动都有独特的子主题。我们的研究尤其是社交媒体平台上的社会运动的主题分析，以及有关AI，伦理和社会相互作用的文献。

translated by 谷歌翻译

Racism is a Virus: Anti-Asian Hate and Counterspeech in Social Media during the COVID-19 Crisis

Bing He , Caleb Ziems , Sandeep Soni , Naren Ramakrishnan , Diyi Yang , Srijan Kumar

分类：自然语言处理

2020-05-25

Covid-19的传播引发了针对亚洲社区的社交媒体的种族主义和仇恨。然而，关于种族仇恨在大流行期间的差异和柜台垂直在减轻这种蔓延的角色时，很少见过。在这项工作中，我们研究了通过推特镜头的反亚洲仇恨演讲的演变和传播。我们创建了Covid-讨厌，这是一个跨越14个月的反亚洲仇恨和柜台的最大数据集，含有超过2.06亿推文，以及超过1.27亿节节点的社交网络。通过创建一个新的手工标记数据集，3,355推文，我们培训文本分类器以识别仇恨和柜台jeech推文，以实现0.832的平均宏F1得分。使用此数据集，我们对推文和用户进行纵向分析。社交网络的分析揭示了可恨和柜台的用户互相互动，彼此广泛地互动，而不是生活在孤立的极化社区中。我们发现在暴露于仇恨内容后，节点很可能变得仇恨。值得注意的是，柜台椎间目可能会阻止用户转向仇恨，可能暗示在Web和社交媒体平台上遏制讨厌的解决方案。数据和代码是在http://claws.cc.gatech.edu/covid。

translated by 谷歌翻译

Vaccine Discourse on Twitter During the COVID-19 Pandemic

Gabriel Lindelöf , Talayeh Aledavood , Barbara Keller

分类：自然语言处理

2022-07-23

自Covid-19大流行病开始以来，疫苗一直是公共话语中的重要话题。疫苗周围的讨论被两极分化，因为有些人认为它们是结束大流行的重要措施，而另一些人则犹豫不决或发现它们有害。这项研究调查了与Twitter上的Covid-19疫苗有关的帖子，并着重于对疫苗有负姿态的帖子。收集了与COVID-19疫苗相关的16,713,238个英文推文的数据集，收集了涵盖从2020年3月1日至2021年7月31日的该期间。我们使用Scikit-Learn Python库来应用支持向量机（SVM）分类器针对Covid-19疫苗的推文具有负姿态。总共使用了5,163个推文来训练分类器，其中有2,484个推文由我们手动注释并公开提供。我们使用Berttopic模型来提取和调查负推文中讨论的主题以及它们如何随时间变化。我们表明，随着疫苗的推出，对COVID-19疫苗的负面影响随时间而下降。我们确定了37个讨论主题，并随着时间的推移介绍了各自的重要性。我们表明，流行的主题包括阴谋讨论，例如5G塔和微芯片，但还涉及涉及疫苗接种安全性和副作用以及对政策的担忧。我们的研究表明，即使是不受欢迎的观点或阴谋论，与广受欢迎的讨论主题（例如Covid-19疫苗）配对时，也会变得广泛。了解问题和讨论的主题以及它们如何随着时间的变化对于政策制定者和公共卫生当局提供更好和时间的信息和政策，以促进未来类似危机的人口接种。

translated by 谷歌翻译

COVID-19 Twitter Dataset with Latent Topics, Sentiments and Emotions Attributes

Raj Kumar Gupta , Ajay Vishwanath , Yinping Yang

分类：自然语言处理

2020-07-14

本文描述了一个关于人们的话语的大型全球数据集以及在Twitter平台上对Covid-19的大流行的反应。从2020年1月28日至2022年6月1日，我们收集并处理了超过2900万个唯一用户的Twitter帖子，使用了四个关键字：“ Corona”，“ Wuhan”，“ NCOV”和“ COVID”。利用概率主题建模和预训练的基于机器学习的情感识别算法，我们将每个推文标记为具有十七个属性，包括a）十个二进制属性，指示了Tweet的相关性（1）或与前十名检测到的主题，B ）五个定量情绪属性表示价或情感的强度程度（从0：极为消极到1：极为积极）以及恐惧，愤怒，悲伤和幸福情感的强度程度（从0：完全不是1到1 ：极度强烈），c）两个分类属性表明情绪（非常负面，消极，中立或混合，积极，非常积极）以及主导的情感（恐惧，愤怒，悲伤，幸福，没有特定的情感），主要是推文表达。我们讨论技术有效性，并报告这些属性的描述性统计，其时间分布和地理表示。本文最后讨论了数据集在传播，心理学，公共卫生，经济学和流行病学中的用法。

translated by 谷歌翻译

Demystifying the COVID-19 vaccine discourse on Twitter

Zainab Zaidi , Mengbin Ye , Fergus John Samon , Abdisalam Jama , Binduja Gopalakrishnan , Chenhao Gu , Shanika Karunasekera , Jamie Evans , Yoshihisa Kashima

分类：自然语言处理

2022-08-29

对社交媒体上的COVID-19疫苗接种的公众讨论不仅对于解决当前的Covid-19-19大流行，而且对于未来的病原体爆发而言至关重要。我们检查了一个Twitter数据集，其中包含7500万英文推文，讨论2020年3月至2021年3月的Covid-19疫苗接种。我们使用自然语言处理（NLP）技术培训了一种立场检测算法，以将推文分为“反Vax”或“ pro-Vax”或“ Pro-Vax” '，并使用主题建模技术检查话语的主要主题。虽然Pro-Vax推文（3700万）远远超过反VAX推文（1000万），但两种姿态的大多数推文（63％的反VAX和53％的Pro-Vax推文）都来自双稳定的用户，他们都发布了两者在观察期间，亲和反VAX推文。 Pro-Vax推文主要集中在疫苗开发上，而反VAX推文则涵盖了广泛的主题，其中一些主题包括真正的问题，尽管存在很大的虚假性。尽管从相反的角度讨论了这两个立场，但两种立场都是常见的。模因和笑话是最转推消息之一。尽管对反vax话语的两极分化和在线流行的担忧是毫无根据的，但针对虚假的有针对性的反驳很重要。

translated by 谷歌翻译

HTML版本

The Moral Foundations Reddit Corpus

Jackson Trager , Alireza S. Ziabari , Aida Mostafazadeh Davani , Preni Golazazian , Farzan Karimi-Malekabadi , Ali Omrani , Zhihe Li , Brendan Kennedy , Nils Karl Reimer , Melissa Reyes

分类：自然语言处理 | 机器学习

2022-08-10

道德框架和情感会影响各种在线和离线行为，包括捐赠，亲环境行动，政治参与，甚至参与暴力抗议活动。自然语言处理中的各种计算方法（NLP）已被用来从文本数据中检测道德情绪，但是为了在此类主观任务中取得更好的性能，需要大量的手工注销训练数据。事实证明，以前对道德情绪注释的语料库已被证明是有价值的，并且在NLP和整个社会科学中都产生了新的见解，但仅限于Twitter。为了促进我们对道德修辞的作用的理解，我们介绍了道德基础Reddit语料库，收集了16,123个reddit评论，这些评论已从12个不同的子雷迪维特策划，由至少三个训练有素的注释者手工注释，用于8种道德情绪（即护理，相称性，平等，纯洁，权威，忠诚，瘦道，隐含/明确的道德）基于更新的道德基础理论（MFT）框架。我们使用一系列方法来为这种新的语料库（例如跨域分类和知识转移）提供基线道德句子分类结果。

translated by 谷歌翻译

Retweet-BERT: Political Leaning Detection Using Language Features and Information Diffusion on Social Networks

Julie Jiang , Xiang Ren , Emilio Ferrara

分类：机器学习

2022-07-18

鉴于社交媒体消费的增加，估计社交媒体使用者的政治倾向是一个具有挑战性且越来越紧迫的问题。我们介绍了retweet-bert，这是一个简单且可扩展的模型，以估算Twitter用户的政治倾向。 retweet-bert利用转发网络结构和用户配置文件描述中使用的语言。我们的假设源于具有类似意识形态的人的网络和语言学的模式。 retweet-bert表现出对其他最先进的基线的竞争性能，在最近的两个Twitter数据集（COVID-19数据集和2020年美国总统选举数据集）中，达到96％-97％的宏观F1。我们还执行手动验证，以验证培训数据中不在培训数据中的用户的retweet-bert的性能。最后，在Covid-19的案例研究中，我们说明了Twitter上政治回声室的存在，并表明它主要存在于正确的倾斜用户中。我们的代码是开源的，我们的数据已公开可用。

translated by 谷歌翻译

Top Gear or Black Mirror: Inferring Political Leaning From Non-Political Content

Ahmet Kurnaz , Scott A. Hale

分类：自然语言处理

2022-08-11

在明确的政治事件（例如选举）的背景下，经常对两极分化和回声室进行研究，而在非政治背景下，很少有学术研究检查了政治团体的混合。在非政治背景下研究政治两极分化的一个主要障碍是，政治倾向（即左派与右取向）通常是未知的。尽管如此，众所周知，政治倾向与许多生活方式选择相关联（有时很强），导致刻板印象，例如“拿铁咖啡自由主义者”。我们开发了一个机器学习分类器，以推断出从非政治文本中倾斜的政治倾向，并且可以选择地，用户在社交媒体上关注的帐户。我们使用在Twitter上共享的选民建议申请结果作为我们的地面图，并在Twitter数据集上训练并测试我们的分类器，其中包括3200个用户的3200个最新推文，此前删除了任何有政治文本的推文。我们将大多数用户的政治倾向正确分类（F1分数从0.70到0.85，具体取决于覆盖范围）。我们发现政治活动水平与我们的分类结果之间没有关系。我们将分类器应用于英国新闻共享的案例研究，发现一般而言，政治新闻的共享表现出独特的左右鸿沟，而体育新闻则没有。

translated by 谷歌翻译

Classifying COVID-19 vaccine narratives

Yue Li , Carolina Scarton , Xingyi Song , Kalina Bontcheva

分类：自然语言处理

2022-07-18

尽管政府的信息运动和谁努力，但Covid-19疫苗犹豫不决是广泛的。其背后的原因之一是疫苗虚假信息在社交媒体中广泛传播。特别是，最近的调查确定，疫苗的虚假信息正在影响COVID-19-19疫苗接种的负面信任。同时，由于大规模的社交媒体，事实检查者正在努力检测和跟踪疫苗虚假信息。为了帮助事实检查员在线监视疫苗叙事，本文研究了一项新的疫苗叙事分类任务，该任务将Covid-19疫苗主张的疫苗索赔分为七个类别之一。遵循数据增强方法，我们首先为这项新的分类任务构建了一个新颖的数据集，重点是少数群体。我们还利用事实检查器注释的数据。该论文还提出了神经疫苗叙事分类器，在交叉验证下达到84％的精度。分类器可公开用于研究人员和记者。

translated by 谷歌翻译

How Much Hate with #china? A Preliminary Analysis on China-related Hateful Tweets Two Years After the Covid Pandemic Began

Jinghua Xu , Zarah Weiss

分类：自然语言处理

2022-11-11

Following the outbreak of a global pandemic, online content is filled with hate speech. Donald Trump's ''Chinese Virus'' tweet shifted the blame for the spread of the Covid-19 virus to China and the Chinese people, which triggered a new round of anti-China hate both online and offline. This research intends to examine China-related hate speech on Twitter during the two years following the burst of the pandemic (2020 and 2021). Through Twitter's API, in total 2,172,333 tweets hashtagged #china posted during the time were collected. By employing multiple state-of-the-art pretrained language models for hate speech detection, we identify a wide range of hate of various types, resulting in an automatically labeled anti-China hate speech dataset. We identify a hateful rate in #china tweets of 2.5% in 2020 and 1.9% in 2021. This is well above the average rate of online hate speech on Twitter at 0.6% identified in Gao et al., 2017. We further analyzed the longitudinal development of #china tweets and those identified as hateful in 2020 and 2021 through visualizing the daily number and hate rate over the two years. Our keyword analysis of hate speech in #china tweets reveals the most frequently mentioned terms in the hateful #china tweets, which can be used for further social science studies.

translated by 谷歌翻译

Dataset of Fake News Detection and Fact Verification: A Survey

Taichi Murayama

分类：机器学习 | 自然语言处理

2021-11-05

假新闻的迅速增加，这对社会造成重大损害，触发了许多假新闻相关研究，包括开发假新闻检测和事实验证技术。这些研究的资源主要是从Web数据中获取的公共数据集。我们通过三个观点调查了与假新闻研究相关的118个数据集：（1）假新闻检测，（2）事实验证，（3）其他任务;例如，假新闻和讽刺检测分析。我们还详细描述了他们的利用任务及其特征。最后，我们突出了假新闻数据集建设中的挑战以及解决这些挑战的一些研究机会。我们的调查通过帮助研究人员找到合适的数据集来促进假新闻研究，而无需重新发明轮子，从而提高了深度的假新闻研究。

translated by 谷歌翻译

Combating Health Misinformation in Social Media: Characterization, Detection, Intervention, and Open Issues

Canyu Chen , Haoran Wang , Matthew Shapiro , Yunyu Xiao , Fei Wang , Kai Shu

分类：人工智能

2022-11-10

Social media has been one of the main information consumption sources for the public, allowing people to seek and spread information more quickly and easily. However, the rise of various social media platforms also enables the proliferation of online misinformation. In particular, misinformation in the health domain has significant impacts on our society such as the COVID-19 infodemic. Therefore, health misinformation in social media has become an emerging research direction that attracts increasing attention from researchers of different disciplines. Compared to misinformation in other domains, the key differences of health misinformation include the potential of causing actual harm to humans' bodies and even lives, the hardness to identify for normal people, and the deep connection with medical science. In addition, health misinformation on social media has distinct characteristics from conventional channels such as television on multiple dimensions including the generation, dissemination, and consumption paradigms. Because of the uniqueness and importance of combating health misinformation in social media, we conduct this survey to further facilitate interdisciplinary research on this problem. In this survey, we present a comprehensive review of existing research about online health misinformation in different disciplines. Furthermore, we also systematically organize the related literature from three perspectives: characterization, detection, and intervention. Lastly, we conduct a deep discussion on the pressing open issues of combating health misinformation in social media and provide future directions for multidisciplinary researchers.

translated by 谷歌翻译

CoVaxNet: An Online-Offline Data Repository for COVID-19 Vaccine Hesitancy Research

Bohan Jiang , Paras Sheth , Baoxin Li , Huan Liu

分类：机器学习

2022-06-30

尽管Covid-19疫苗对病毒取得了惊人的成功，但很大一部分人口仍然不愿接受疫苗接种，这破坏了政府控制该病毒的努力。为了解决这个问题，我们需要了解导致这种行为的不同因素，包括社交媒体话语，新闻媒体宣传，政府的回应，人口统计和社会经济地位以及COVID-19统计等等。涵盖所有这些方面，使得在推断疫苗犹豫的问题时很难形成完整的情况。在本文中，我们构建了一个多源，多模式和多功能在线数据存储库Covaxnet。我们提供描述性分析和见解，以说明Covaxnet中的关键模式。此外，我们提出了一种新颖的方法来连接在线和离线数据，以促进利用互补信息源的推理任务。

translated by 谷歌翻译

Understanding COVID-19 Vaccine Reaction through Comparative Analysis on Twitter

Yuesheng Luo , Mayank Kejriwal

分类：自然语言处理

2021-11-10

虽然现在几个月有多个Covid-19疫苗，但疫苗犹豫不决在美国的高水平。部分内容也已成为政治化，特别是自11月总统选举以来。在包括Twitter的社交媒体背景下，在此期间理解疫苗犹豫不决，可以为计算社会科学家和决策者提供有价值的指导。本文通过相对研究两个不同的时间段（选举前的一个，另一个月之后的另一个月，另一个月）采用相对研究的两个Twitter数据集，而不是研究单一的Twitter语料库，而不是研究单个Twitter语料库。数据收集和过滤方法。我们的研究结果表明，从2020年到2021年秋天的政治到Covid-19疫苗的讨论中讨论了重大转变。通过使用基于集群和机器学习的方法与采样和定性分析，我们发现了几种细粒度疫苗犹豫不决的原因，其中一些随着时间的推移而变得更加（或更少）。我们的结果还强调了去年这个问题的强烈极化和政治化。

translated by 谷歌翻译

Politics, Sentiment and Virality: A Large-Scale Multilingual Twitter Analysis in Greece, Spain and United Kingdom

Dimosthenis Antypas , Alun Preece , Jose Camacho-Collados

分类：自然语言处理 | 机器学习

2022-02-01

社交媒体在现代社会中尤其是在西方世界中的政策制定方面已经变得极其影响力（例如，48％的欧洲人每天或几乎每天都使用社交媒体）。 Twitter之类的平台使用户可以关注政客，从而使公民更多地参与政治讨论。同样，政客们使用Twitter来表达他们的观点，在当前主题上进行辩论，并促进其政治议程，以影响选民行为。先前的研究表明，传达负面情绪的推文可能会更频繁地转发。在本文中，我们试图分析来自不同国家的政客的推文，并探索他们的推文是否遵循相同的趋势。利用最先进的预训练的语言模型，我们对从希腊，西班牙和英国的成千上万的推文进行了情感分析，包括权威的行政部门。我们通过系统地探索和分析有影响力和不流行的推文之间的差异来实现这一目标。我们的分析表明，政治家的负面推文更广泛地传播，尤其是在最近的时代，并突出了情感和受欢迎程度相交的有趣趋势。

translated by 谷歌翻译

Two-Stage Classifier for COVID-19 Misinformation Detection Using BERT: a Study on Indonesian Tweets

Douglas Raevan Faisal , Rahmad Mahendra

分类：自然语言处理

2022-06-30

自2020年初以来，Covid-19-19造成了全球重大影响。这给社会带来了很多困惑，尤其是由于错误信息通过社交媒体传播。尽管已经有几项与在社交媒体数据中发现错误信息有关的研究，但大多数研究都集中在英语数据集上。印度尼西亚的COVID-19错误信息检测的研究仍然很少。因此，通过这项研究，我们收集和注释印尼语的数据集，并通过考虑该推文的相关性来构建用于检测COVID-19错误信息的预测模型。数据集构造是由一组注释者进行的，他们标记了推文数据的相关性和错误信息。在这项研究中，我们使用印度培训预培训的语言模型提出了两阶段分类器模型，以进行推文错误信息检测任务。我们还尝试了其他几种基线模型进行文本分类。实验结果表明，对于相关性预测，BERT序列分类器的组合和用于错误信息检测的BI-LSTM的组合优于其他机器学习模型，精度为87.02％。总体而言，BERT利用率有助于大多数预测模型的更高性能。我们发布了高质量的Covid-19错误信息推文语料库，用高通道一致性表示。

translated by 谷歌翻译

Machine Learning-based Automatic Annotation and Detection of COVID-19 Fake News

Mohammad Majid Akhtar , Bibhas Sharma , Ishan Karunanayake , Rahat Masood , Muhammad Ikram , Salil S. Kanhere

分类：机器学习

2022-09-07

Covid-19影响了世界各地，尽管对爆发的错误信息的传播速度比病毒更快。错误的信息通过在线社交网络（OSN）传播，通常会误导人们遵循正确的医疗实践。特别是，OSN机器人一直是传播虚假信息和发起网络宣传的主要来源。现有工作忽略了机器人的存在，这些机器人在传播中充当催化剂，并专注于“帖子中共享的文章”而不是帖子（文本）内容中的假新闻检测。大多数关于错误信息检测的工作都使用手动标记的数据集，这些数据集很难扩展以构建其预测模型。在这项研究中，我们通过在Twitter数据集上使用经过验证的事实检查的陈述来标记数据来克服这一数据稀缺性挑战。此外，我们将文本功能与用户级功能（例如关注者计数和朋友计数）和推文级功能（例如Tweet中的提及，主题标签和URL）结合起来，以充当检测错误信息的其他指标。此外，我们分析了推文中机器人的存在，并表明机器人随着时间的流逝改变了其行为，并且在错误信息中最活跃。我们收集了1022万个Covid-19相关推文，并使用我们的注释模型来构建一个广泛的原始地面真实数据集以进行分类。我们利用各种机器学习模型来准确检测错误信息，我们的最佳分类模型达到了精度（82％），召回（96％）和假阳性率（3.58％）。此外，我们的机器人分析表明，机器人约为错误信息推文的10％。我们的方法可以实质性地暴露于虚假信息，从而改善了通过社交媒体平台传播的信息的可信度。

translated by 谷歌翻译

Perspectives of Non-Expert Users on Cyber Security and Privacy: An Analysis of Online Discussions on Twitter

Nandita Pattnaik , Shujun Li , Jason R. C. Nurse

分类：机器学习

2022-06-05

Current research on users` perspectives of cyber security and privacy related to traditional and smart devices at home is very active, but the focus is often more on specific modern devices such as mobile and smart IoT devices in a home context. In addition, most were based on smaller-scale empirical studies such as online surveys and interviews. We endeavour to fill these research gaps by conducting a larger-scale study based on a real-world dataset of 413,985 tweets posted by non-expert users on Twitter in six months of three consecutive years (January and February in 2019, 2020 and 2021). Two machine learning-based classifiers were developed to identify the 413,985 tweets. We analysed this dataset to understand non-expert users` cyber security and privacy perspectives, including the yearly trend and the impact of the COVID-19 pandemic. We applied topic modelling, sentiment analysis and qualitative analysis of selected tweets in the dataset, leading to various interesting findings. For instance, we observed a 54% increase in non-expert users` tweets on cyber security and/or privacy related topics in 2021, compared to before the start of global COVID-19 lockdowns (January 2019 to February 2020). We also observed an increased level of help-seeking tweets during the COVID-19 pandemic. Our analysis revealed a diverse range of topics discussed by non-expert users across the three years, including VPNs, Wi-Fi, smartphones, laptops, smart home devices, financial security, and security and privacy issues involving different stakeholders. Overall negative sentiment was observed across almost all topics non-expert users discussed on Twitter in all the three years. Our results confirm the multi-faceted nature of non-expert users` perspectives on cyber security and privacy and call for more holistic, comprehensive and nuanced research on different facets of such perspectives.

translated by 谷歌翻译

Breaking the Communities: Characterizing community changing users using text mining and graph machine learning on Twitter

Federico Albanese , Leandro Lombardi , Esteban Feuerstein , Pablo Balenzuela

分类：机器学习

2020-08-24

即使互联网和社交媒体增加了人们可能会消耗的新闻和信息量，大多数用户才会暴露于加强其职位的内容，并将其与其他思想社区隔离。这种环境对我们的生活产生了极大的影响，如严重的政治极化，轻松传播的假新闻，政治极端主义，仇恨团体以及缺乏丰富的辩论等。因此，鼓励不同的用户组之间的对话并打破封闭的社区对健康社会的重要性。在本文中，我们使用自然语言处理技术和图形机学习算法来表征和研究在Twitter上打破社区的用户。特别是，我们从150万用户收集了900万个Twitter消息，并构建了转发网络。我们确定了他们的社区和与他们相关的讨论主题。通过这些数据，我们为社交媒体用户分类提供了一种机器学习框架，该分类检测到“社区分手”，即从他们的封闭社区到另一个用户的用户。三个Twitter极化政治数据集中的一个特征重要性分析表明，这些用户的PageRank值低，表明改变是推动的，因为他们的消息在其社区中没有响应。这种方法还允许我们确定其特定的兴趣主题，提供了这种用户的全面表征。

translated by 谷歌翻译