Я пытаюсь подсчитать уникальные значения в массиве numpy.подсчет уникальных элементов в массиве numpy: почему scipy.stats.itemfreq так медленно?
import numpy as np
from collections import defaultdict
import scipy.stats
import time
x = np.tile([1,2,3,4,5,6,7,8,9,10],20000)
for i in [44,22,300,403,777,1009,800]:
x[i] = 11
def getCounts(x):
counts = defaultdict(int)
for item in x:
counts[item] += 1
return counts
flist = [getCounts, scipy.stats.itemfreq]
for f in flist:
print f
t1 = time.time()
y = f(x)
t2 = time.time()
print y
print '%.5f sec' % (t2-t1)
Я не мог найти встроенную функцию в первый, чтобы сделать это, так что я написал getCounts()
; то я нашел scipy.stats.itemfreq
, поэтому подумал, что буду использовать это вместо этого. Но это медленно! Вот что я получаю на своем ПК. Почему это так медленно по сравнению с такой простой рукописной функцией?
<function getCounts at 0x0000000013C78438>
defaultdict(<type 'int'>, {1: 19998, 2: 20000, 3: 19999, 4: 19999, 5: 19999, 6: 20000, 7: 20000, 8: 19999, 9: 20000, 10: 19999, 11: 7})
0.04700 sec
<function itemfreq at 0x0000000013C5D208>
[[ 1.00000000e+00 1.99980000e+04]
[ 2.00000000e+00 2.00000000e+04]
[ 3.00000000e+00 1.99990000e+04]
[ 4.00000000e+00 1.99990000e+04]
[ 5.00000000e+00 1.99990000e+04]
[ 6.00000000e+00 2.00000000e+04]
[ 7.00000000e+00 2.00000000e+04]
[ 8.00000000e+00 1.99990000e+04]
[ 9.00000000e+00 2.00000000e+04]
[ 1.00000000e+01 1.99990000e+04]
[ 1.10000000e+01 7.00000000e+00]]
2.04100 sec
Существует эта проблема с этой функцией [здесь] (https://github.com/scipy/scipy/issues/599). Похоже, что у сопровождающих была схожая озабоченность по поводу того, как она была написана. Если вы хотите знать, почему это было так медленно, возможно, проверьте [это фиксация] (https://github.com/scipy/scipy/commit/7e04d6630f229693cca3522b62aa16226f174053). В зависимости от того, используете ли вы scipy версию до или после этой фиксации, вы сможете увидеть, как она реализована. – jedwards