2016-04-07 2 views
0

У меня есть файл csv, только 4 из 4000 записей содержат некоторые символы, отличные от ASCII. НапримерPython: удалить non ascii charecters из csv

['com.manager', '2016', '16.1.23', 'en', 'kinzie', '2015-04-11T17:36:23Z', '1428773783781', '2016-03-11T09:53:45Z', 'df', '5', "\xa5\x06`'", '\xc0\x03"', '\xa2{\xac ===]\xa9}\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7>', '', '', '', 'https://play.google.com/apps/publish?account=sd#ReviewDetailsPlace:p=com.manager&reviewid=gp:AOqpTOEcQQGmjFcd-bFfU372DTrxh'] 

Я использую следующий код питона читать CSV-

with open('/Users/duttaam/Downloads/test1.csv', 'rU') as csvfile: 
    reader_obj = csv.reader(x.replace('\0', '') for x in csvfile) 
    rownum=0 
    for row in reader_obj: 
     rownum += 1 
     if len(row) != 16: 
      print rownum 
      print row 

Для четыре строки читателя, показывая непоследовательные номера столбцов. Но когда я подсчитал разделители (,) в этих строках, это показывает хорошо. Только проблема, которую я видел, - это не ascii-символы в качестве строки примера, показанной в приведенной выше строке. Я предполагаю, что это некоторые эможи, превращенные в некоторые символы.

я придумал функцию, чтобы удалить непечатаемые символы из строки, как я применить это ко всему CSV (Благодаря следующее сообщение: Stripping non printable characters from a string in python)?

def removeSpecialcahr(s): 
     printable = set(string.printable) 
     return filter(lambda x: x in printable, s) 

Есть ли способ, чтобы обработать csv и удалить все непечатаемые и/или не-ascii символы?

Спасибо заранее.

ответ

4

Чтобы удалить символы, отличные от ASCII, из вашего файла, замените свой open звонок на номер codecs.open(). Вы также можете определить свой собственный обработчик ошибок ...:

import codecs 
codecs.open('file.csv', 'r', encoding='ascii', errors='ignore') 
+0

Спасибо @joeforker. Я использовал код и удалил символы non-ascii, но когда я использую следующий код для чтения файлового объекта 'reader_obj = csv.reader (x.replace ('\ 0', '') для x в csvfile) rownum = 0 для строки в reader_obj: RowNum + = 1 если Len (строка) = 16: печать ROWNUM печать строки печать Len (строка) 'читатель CSV не читает файл правильно. Однако ваш код действительно отвечает на мой вопрос. Кстати какой-нибудь другой способ эффективно читать csv? – Dutta

+0

Вы можете попробовать модуль unicodecsv: https://pypi.python.org/pypi/unicodecsv – joeforker

Смежные вопросы