#825·marker

大型 PDF 文件出现内存不足问题,即使将其分解成 5 页进行处理

作者: AkshayBhure098创建于 2025年8月6日更新于 2026年9月7日

1) Determine model cache directory

if model_cache_dir: cache_dir = model_cache_dir else:

Download from S3

bucket = os.environ.get('sparse_model_bucket', DEFAULT_BUCKET) key = os.environ.get('sparse_model_key', DEFAULT_KEY) logging.info(f"[Marker] Downloading model zip from S3://{bucket}/{key}...") downloader = DownloadLoadModels() zip_path = downloader.download_model_from_s3(bucket, key) if not zip_path or not os.path.exists(zip_path): raise RuntimeError(f"Failed to download model zip (S3://{bucket}/{key}).")

2) Unzip and detect model folder

model_folder = downloader.unzip_file_sparse(zip_path, extract_to='.') if not model_folder or not os.path.isdir(model_folder): raise RuntimeError(f"Unzip did not produce a valid model folder: {model_folder!r}") logging.info(f"[Marker] Unzipped model to: {model_folder}") cache_dir = model_folder

内容来源: datalab-to/marker