Apache Beam 工作流无法为 Google Cloud 中的 criteo_preprocess.py 最大化工作者数量
作者: Arith2创建于 2024年2月21日更新于 2026年9月11日
标签stat:awaiting responsetype:bugmodels:officialstale
先决条件
在提出问题之前,请回答以下问题。
- 我在使用最新的"特森福克"模式花园发行版和"特森福克"2版.
- [x]我向正确的存储器报告这个问题。 (示范花园官方或研究目录)
- 我检查过,以确保这个问题还没有提交过。
^ 1. 您正在使用的文件的全部 URL
https://GitHub.com/tensorflow/models/blob/master/official/advision/leader/precession/criteo preprocess.py.
□ 2. 描述虫子
- Apache Beam管道无法使工人人数最大化,增加Google Cloud预处理的并行性
- 我把物体存储和计算引擎放在同一区域.
- 我使用"gsutil perfdiag -n 10 -s 100M-c 1 gs://my storage"来测试Google Cloud存储的吞吐量,876 Mbit/s用于书写,1.56 Gbit/s用于阅读.
- 当我尝试生成词汇并运行"Python criteo process.py -- input path "${STORAGE BUKET}/criteo sharted/training/*" --put path "${STORAGE BUKET}/criteo out/" --temp dir "${STORAGE BUKET}/criteo vocab/" --vocab gen mode --runner DataflowRunner --max vocab s 5000 --project ${PROJECT}-region ${区域}"时,结果非常缓慢。 当输入数据集的大小为11GB时需要30mins.
- 我使用htop并发现这个Python命令有三个过程. 所有核心的利用率已接近0,只有一线程正在积极运行.
- 我还使用 shard reablier.py 来分割输入数据集为64或1024. 没有任何改进。
□ 3. 复制步骤
- 输入数据集: Criteo Kaggle的培训文本,约11GB. 我以"Google Cloud"的形式在西欧1号上传. https://www.kaggle.com/datasets/mrkmakr/criteo-dataset?资源=下行负荷.
- 计算西欧1-b的c2d-高克普-32发动机
- 具体指明项目、项目、区域
- 执行上面的Python命令。
□ 4. 预期行为
- Apache Beam管道可以最大限度地增加运行的工人人数
□ 6. 系统信息
- OS平台与发行:Linux 6.1.0-18-cloud-amd64 x86 64
- 从(来源或二进制)安装的tensorFlow: setup.py
- TensorFlow版本: 2.1.5.
- Python版本:3.9.2
{\fn华文仿宋\fs16\1cHD1D1D1}快跑! 利用我们的环境捕捉脚本收集系统信息. https://GitHub.com/tensorflow/tensorflow/tree/master/tools/tf env collection.sh 页面存档备份,存于互联网档案馆.
也可以通过:
十角花 1.0 `Python-c' 以tf; 打印形式导入热流; ””
十角花 2.0 `Python-c' 以 tf; 打印 (tf.version.) 形式导入收发量。 (原始内容存档于2017-10-21) (英语). GIT VERSION, tf.version.verSION)". . > 时间
内容来源: tensorflow/models