python - 如何正則字符串中的所有漢字
問題描述
這樣算嗎?121238asdf<img src='https://imgsa.baidu.com/forum/w%3D580/sign=da0493cd90ef76c6d0d2fb23ad14fdf6/e483aa4bd11373f0bddb2e73a40f4bfbf9ed04b1.jpg' height='420'>
字符串如上,類型是’str’,要正則獲得漢字。我之前使用[u4e00-u9fa5]結果獲得的還是英文,符號跟數字的list。求教導正確姿勢。另外說說我哪里寫錯了..
pattern = re.compile(r’[u4E00-u9FA5]’)print pattern.findall(x[1])
這是我寫的...但是返回結果就沒有漢字,反而是除漢字外的其他字符。
問題解答
回答1:我這里假設你需要匹配的文本為s:
pattern = re.compile(ur'[u4e00-u9fa5]')print pattern.findall(s.decode(’utf8’))
這里的decode(’utf8’)是怕s的值為類似x66x77x88這樣的Unicode散列。另外,需要注意compile()中ur修飾符,u為Unicode修飾符。
PS:我是從這篇文章得到的啟發。
Update剛才看了下樓下說的,確實用Python 3就不存在輸出為Unicode散列的情況了,以下摘自此處
Unicode 字符串在Python2中,普通字符串是以8位ASCII碼進行存儲的,而Unicode字符串則存儲為16位unicode字符串,這樣能夠表示更多的字符集。使用的語法是在字符串前面加上前綴 u。
在Python3中,所有的字符串都是Unicode字符串。
回答2:你用的是python2,uxxxx是unicode字符,匹配后得到的是字節串,print出來是各個字節值。
換python3 就沒這個問題了
相關文章:
1. python文檔怎么查看?2. android - NavigationView 的側滑菜單中如何保存新增項(通過程序添加)3. javascript - ios返回不執行js怎么解決?4. javascript - 請問一下vue當中是在什么時候請求數據保存全局變量的?5. 除了 python2 和 python3,ipython notebook 還可以用哪些內核?6. 這段代碼既不提示錯誤也看不到結果,請老師明示錯在哪里,謝謝!7. mysql - 怎么生成這個sql表?8. 提示語法錯誤語法錯誤: unexpected ’abstract’ (T_ABSTRACT)9. tp5 不同控制器中的變量調用問題10. 數據庫 - mysql如何處理數據變化中的事務?
