How to update nltk package so that it does not break email into 3 different tokens?(如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?)
本文介绍了如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!
问题描述
当我键入以下代码时:
tokens = word_tokenize("a@b.com")
它分为以下3个标记:‘a’、‘@’、‘b.com’
我想做的是将其保留为单个令牌‘a@b.com’。
推荐答案
免责声明:有很多电子邮件正则表达式。我并没有尝试匹配此问题中的所有电子邮件格式,只是显示了一个示例。
使用RegexpTokenizer
(mentioned abovebylenz)的正则表达式方法可以工作:
from nltk.tokenize.regexp import RegexpTokenizer
line="My email: a@bc.com is not accessible."
pattern = r'S+@[^s.]+.[a-zA-Z]+|w+|[^ws]'
tokeniser=RegexpTokenizer(pattern)
tokeniser.tokenize(line)
# => ['My', 'email', ':', 'a@bc.com', 'is', 'not', 'accessible', '.']
正则表达式匹配:
S+@[^s.]+.[a-zA-Z]+
-文本看起来像电子邮件:S+
-1个或更多非空格字符@
-a@
符号[^s.]+
-1个或更多除空格和.
以外的字符.
-文字点[a-zA-Z]+
-1个或更多ASCII字母
|
-或w+
-1个或多个单词字符(字母、数字或下划线)|
-或[^ws]
-单词和空格字符以外的单个字符(在其后面添加+
以匹配1或更多的序列)。
请参阅online regex demo。
这篇关于如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持编程学习网!
沃梦达教程
本文标题为:如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?
基础教程推荐
猜你喜欢
- 如何在Python中绘制多元函数? 2022-01-01
- 使 Python 脚本在 Windows 上运行而不指定“.py";延期 2022-01-01
- 使用Python匹配Stata加权xtil命令的确定方法? 2022-01-01
- 合并具有多索引的两个数据帧 2022-01-01
- 哪些 Python 包提供独立的事件系统? 2022-01-01
- 如何在 Python 中检测文件是否为二进制(非文本)文 2022-01-01
- Python 的 List 是如何实现的? 2022-01-01
- 症状类型错误:无法确定关系的真值 2022-01-01
- 使用 Google App Engine (Python) 将文件上传到 Google Cloud Storage 2022-01-01
- 将 YAML 文件转换为 python dict 2022-01-01