#11166·models

Apache Beam 工作流无法为 Google Cloud 中的 criteo_preprocess.py 最大化工作者数量

作者: Arith2创建于 2024年2月21日更新于 2026年9月11日
标签stat:awaiting responsetype:bugmodels:officialstale

先决条件

在提出问题之前,请回答以下问题。

  • 我在使用最新的"特森福克"模式花园发行版和"特森福克"2版.
  • [x]我向正确的存储器报告这个问题。 (示范花园官方或研究目录)
  • 我检查过,以确保这个问题还没有提交过。

^ 1. 您正在使用的文件的全部 URL

https://GitHub.com/tensorflow/models/blob/master/official/advision/leader/precession/criteo preprocess.py.

□ 2. 描述虫子

  1. Apache Beam管道无法使工人人数最大化,增加Google Cloud预处理的并行性
  2. 我把物体存储和计算引擎放在同一区域.
  3. 我使用"gsutil perfdiag -n 10 -s 100M-c 1 gs://my storage"来测试Google Cloud存储的吞吐量,876 Mbit/s用于书写,1.56 Gbit/s用于阅读.
  4. 当我尝试生成词汇并运行"Python criteo process.py -- input path "${STORAGE BUKET}/criteo sharted/training/*" --put path "${STORAGE BUKET}/criteo out/" --temp dir "${STORAGE BUKET}/criteo vocab/" --vocab gen mode --runner DataflowRunner --max vocab s 5000 --project ${PROJECT}-region ${区域}"时,结果非常缓慢。 当输入数据集的大小为11GB时需要30mins.
  5. 我使用htop并发现这个Python命令有三个过程. 所有核心的利用率已接近0,只有一线程正在积极运行.
  6. 我还使用 shard reablier.py 来分割输入数据集为64或1024. 没有任何改进。

□ 3. 复制步骤

  1. 输入数据集: Criteo Kaggle的培训文本,约11GB. 我以"Google Cloud"的形式在西欧1号上传. https://www.kaggle.com/datasets/mrkmakr/criteo-dataset?资源=下行负荷.
  2. 计算西欧1-b的c2d-高克普-32发动机
  3. 具体指明项目、项目、区域
  4. 执行上面的Python命令。

□ 4. 预期行为

  • Apache Beam管道可以最大限度地增加运行的工人人数

□ 6. 系统信息

  • OS平台与发行:Linux 6.1.0-18-cloud-amd64 x86 64
  • 从(来源或二进制)安装的tensorFlow: setup.py
  • TensorFlow版本: 2.1.5.
  • Python版本:3.9.2

{\fn华文仿宋\fs16\1cHD1D1D1}快跑! 利用我们的环境捕捉脚本收集系统信息. https://GitHub.com/tensorflow/tensorflow/tree/master/tools/tf env collection.sh 页面存档备份,存于互联网档案馆.

也可以通过:

  1. 十角花 1.0 `Python-c' 以tf; 打印形式导入热流; ””

  2. 十角花 2.0 `Python-c' 以 tf; 打印 (tf.version.) 形式导入收发量。 (原始内容存档于2017-10-21) (英语). GIT VERSION, tf.version.verSION)". . > 时间

内容来源: tensorflow/models