2016-12-21 5 views
2

У меня есть dataframe, содержащийПанды: TypeError: поплавок() аргумент должен быть строкой или числом

user_id date  browser conversion test sex age country 
    1 2015-12-03  IE  1   0 M 32.0 US 

Это весь мой код до сих пор!

data["country"].fillna("missing") 
data["age"].fillna(-10000, inplace=True) 
data["ads_channel"].fillna("missing") 
data["sex"].fillna("missing") 
data['date'] = pd.to_datetime(data.date) 

columns = data.columns.tolist() 
columns = [c for c in columns if c not in ["test"]] 
from sklearn import tree 
clf = tree.DecisionTreeClassifier(max_depth=2, min_samples_leaf = (len(data)/100)) 
clf = clf.fit(data[columns],data["test"]) 

Я получаю эту ошибку:

--------------------------------------------------------------------------- 
TypeError         Traceback (most recent call last) 
<ipython-input-560-95a8a54aa939> in <module>() 
     4 from sklearn import tree 
     5 clf = tree.DecisionTreeClassifier(max_depth=2, min_samples_leaf = (len(data)/100)) 
----> 6 clf = clf.fit(data[columns],data["test"]) 

C:\Users\SnehaPriya\Anaconda2\lib\site-packages\sklearn\tree\tree.pyc in fit(self, X, y, sample_weight, check_input, X_idx_sorted) 
    152   random_state = check_random_state(self.random_state) 
    153   if check_input: 
--> 154    X = check_array(X, dtype=DTYPE, accept_sparse="csc") 
    155    if issparse(X): 
    156     X.sort_indices() 

C:\Users\SnehaPriya\Anaconda2\lib\site-packages\sklearn\utils\validation.pyc in check_array(array, accept_sparse, dtype, order, copy, force_all_finite, ensure_2d, allow_nd, ensure_min_samples, ensure_min_features, warn_on_dtype, estimator) 
    371          force_all_finite) 
    372  else: 
--> 373   array = np.array(array, dtype=dtype, order=order, copy=copy) 
    374 
    375   if ensure_2d: 

TypeError: float() argument must be a string or a number 

Я до сих пор учусь код, и я хотел бы знать, как преодолеть эту ошибку. Любая помощь будет высоко оценена!

+0

Кажется, вы забыли 'INPLACE = true' в' данных [ "страна"] fillna ("отсутствует ")' 'data [" ads_channel "]. fillna (" missing ")' и 'data [" sex "]. fillna (" missing ")' – jezrael

+0

Так что используйте 'data [" country "]. fillna (" missing " , inplace = True) данные ["ads_channel"]. fillna ("missing", inplace = True) данные ["sex"]. fillna ("missing", inplace = True) ' – jezrael

+0

Другим возможным решением является «данные [[« страна »,« ads_channel »,« sex »]] = данные [[« страна »,« ads_channel »,« sex »]]. Fillna (« missing ») ' – jezrael

ответ

3

IIUC вам нужно исключить столбец date также:

columns = [c for c in columns if c not in ["test", 'date']] 

, потому что ошибка:.

TypeError: float() argument must be a string or a number, not 'Timestamp'

+0

Это сработало отлично! Спасибо! – Gingerbread

Смежные вопросы