0
我是PySpark的新手,我想了解如何在PySpark中編寫多個嵌套for循環,下面是粗略的高級示例。 任何幫助將不勝感激。用於嵌套循環的pyspark程序
for (i=0;i<10;i++)
for (j=0;j<10;j++)
for (k=0;k<10;k++)
{
print "i"."j"."k"
}
我是PySpark的新手,我想了解如何在PySpark中編寫多個嵌套for循環,下面是粗略的高級示例。 任何幫助將不勝感激。用於嵌套循環的pyspark程序
for (i=0;i<10;i++)
for (j=0;j<10;j++)
for (k=0;k<10;k++)
{
print "i"."j"."k"
}
在非分佈式設置for循環使用foreach
組合子改寫,但由於星火性質map
和flatMap
是一個更好的選擇:
from __future__ import print_function
a_loop = lambda x: ((x, y) for y in xrange(10))
print_me = lambda ((x, y), z): print("{0}.{1}.{2}".format(x, y, z)))
(sc.
parallelize(xrange(10)).
flatMap(a_loop).
flatMap(a_loop).
foreach(print_me)
使用itertools.product
作者:
from itertools import product
sc.parallelize(product(xrange(10), repeat=3)).foreach(print)