2015-07-20 80 views
0

我是PySpark的新手,我想了解如何在PySpark中編寫多個嵌套for循環,下面是粗略的高級示例。 任何幫助將不勝感激。用於嵌套循環的pyspark程序

for (i=0;i<10;i++) 
    for (j=0;j<10;j++) 
     for (k=0;k<10;k++) 
      { 
      print "i"."j"."k" 
} 

回答

4

在非分佈式設置for循環使用foreach組合子改寫,但由於星火性質mapflatMap是一個更好的選擇:

from __future__ import print_function 
a_loop = lambda x: ((x, y) for y in xrange(10)) 
print_me = lambda ((x, y), z): print("{0}.{1}.{2}".format(x, y, z))) 

(sc. 
    parallelize(xrange(10)). 
    flatMap(a_loop). 
    flatMap(a_loop). 
    foreach(print_me) 

使用itertools.product作者:

from itertools import product 
sc.parallelize(product(xrange(10), repeat=3)).foreach(print)