How to add/append a row to a particular partition in the dask dataframe?(如何将行添加/追加到DaskDataFrame中的特定分区?)
本文介绍了如何将行添加/追加到DaskDataFrame中的特定分区?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!
问题描述
我想将一行追加到DaskDataFrames中的特定分区。我试过很多方法,但没有一个是可行的。有人能帮我这个忙吗。提前感谢
我试过-
first_partition = df.partitions[0]
new_dd = first_partiton.append(row)
df.partitions[0] = new_dd
这不起作用
我甚至尝试使用map_artitions(),但即使是这个函数也不能真正帮助获取分区的元数据来修改特定分区。
是否可以将数据帧保存为拼图文件,然后只修改特定的拼图文件并将其保存回来?-我尝试了这个方法,但似乎也不起作用。
推荐答案
使用map_partitions
可以修改该特定分区。
然后通过切换到延迟对象来替换数据帧中已修改的分区来创建新帧,将延迟对象替换到列表中,然后切换回DaskDataFrame。
def append_row_dict(df, row_dict):
small_df = pd.DataFrame(row_dict)
return df.append(small_df)
p_df = pd.DataFrame({'a':np.arange(0,10)})
dask_df = dd.from_pandas(p_df,npartitions=4)
part_to_change = 1
new_partion = dask_df.get_partition(part_to_change).map_partitions(append_row_dict,{'a':[-1]})
list_of_delayed = dask_df.to_delayed()
## we only have 1 delayed object for 1 partition
assert new_partion.npartitions==1
list_of_delayed[part_to_change]=new_partion.to_delayed()[0]
new_dask_df = dd.from_delayed(list_of_delayed, meta=dask_df._meta)
new_dask_df.get_partition(part_to_change).compute()
a
3 3
4 4
5 5
0 -1
这篇关于如何将行添加/追加到DaskDataFrame中的特定分区?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持编程学习网!
沃梦达教程
本文标题为:如何将行添加/追加到DaskDataFrame中的特定分区?
基础教程推荐
猜你喜欢
- 哪些 Python 包提供独立的事件系统? 2022-01-01
- 使用 Google App Engine (Python) 将文件上传到 Google Cloud Storage 2022-01-01
- 使 Python 脚本在 Windows 上运行而不指定“.py";延期 2022-01-01
- 将 YAML 文件转换为 python dict 2022-01-01
- 合并具有多索引的两个数据帧 2022-01-01
- 如何在Python中绘制多元函数? 2022-01-01
- 使用Python匹配Stata加权xtil命令的确定方法? 2022-01-01
- 如何在 Python 中检测文件是否为二进制(非文本)文 2022-01-01
- Python 的 List 是如何实现的? 2022-01-01
- 症状类型错误:无法确定关系的真值 2022-01-01