大型 PDF 文件出现内存不足问题,即使将其分解成 5 页进行处理
1) Determine model cache directory
if model_cache_dir: cache_dir = model_cache_dir else:
Download from S3
bucket = os.environ.get('sparse_model_bucket', DEFAULT_BUCKET) key = os.environ.get('sparse_model_key', DEFAULT_KEY) logging.info(f"[Marker] Downloading model zip from S3://{bucket}/{key}...") downloader = DownloadLoadModels() zip_path = downloader.download_model_from_s3(bucket, key) if not zip_path or not os.path.exists(zip_path): raise RuntimeError(f"Failed to download model zip (S3://{bucket}/{key}).")
2) Unzip and detect model folder
model_folder = downloader.unzip_file_sparse(zip_path, extract_to='.') if not model_folder or not os.path.isdir(model_folder): raise RuntimeError(f"Unzip did not produce a valid model folder: {model_folder!r}") logging.info(f"[Marker] Unzipped model to: {model_folder}") cache_dir = model_folder
内容来源: datalab-to/marker