如何将行添加/追加到DaskDataFrame中的特定分区?

How to add/append a row to a particular partition in the dask dataframe?(如何将行添加/追加到DaskDataFrame中的特定分区?)

本文介绍了如何将行添加/追加到DaskDataFrame中的特定分区?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!

问题描述

我想将一行追加到DaskDataFrames中的特定分区。我试过很多方法,但没有一个是可行的。有人能帮我这个忙吗。提前感谢

我试过-

first_partition = df.partitions[0]
new_dd = first_partiton.append(row)
df.partitions[0] = new_dd

这不起作用

我甚至尝试使用map_artitions(),但即使是这个函数也不能真正帮助获取分区的元数据来修改特定分区。

是否可以将数据帧保存为拼图文件,然后只修改特定的拼图文件并将其保存回来?-我尝试了这个方法,但似乎也不起作用。

推荐答案

使用map_partitions可以修改该特定分区。

然后通过切换到延迟对象来替换数据帧中已修改的分区来创建新帧,将延迟对象替换到列表中,然后切换回DaskDataFrame。


def append_row_dict(df, row_dict):
    small_df = pd.DataFrame(row_dict)
    return df.append(small_df)
    
p_df = pd.DataFrame({'a':np.arange(0,10)})

dask_df = dd.from_pandas(p_df,npartitions=4)
part_to_change = 1

new_partion = dask_df.get_partition(part_to_change).map_partitions(append_row_dict,{'a':[-1]})
list_of_delayed = dask_df.to_delayed()

## we only have 1 delayed object for 1 partition
assert new_partion.npartitions==1
list_of_delayed[part_to_change]=new_partion.to_delayed()[0]

new_dask_df = dd.from_delayed(list_of_delayed, meta=dask_df._meta)
new_dask_df.get_partition(part_to_change).compute()
    a
3   3
4   4
5   5
0   -1

这篇关于如何将行添加/追加到DaskDataFrame中的特定分区?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持编程学习网!

本文标题为:如何将行添加/追加到DaskDataFrame中的特定分区?

基础教程推荐