#458·olmocr

让模型运行在更低的GPU上而牺牲时间/速度

作者: Ghost49X创建于 2026年4月21日更新于 2026年4月21日
  • 特征、动机和投出

添加命令行旗(例如 --max-model-len),允许用户: 手动将上下文窗口(例如:为4096或8192)盖上以适应更小的VRAM缓冲.

换取处理速度或上下文大小,使模型能在12GB,10GB,或8GB GPU上运行.

这将使操作当地工作站而不是服务器级硬件的更广泛的研究人员和爱好者能够使用这一工具。

替代品

无回复( N)

其他背景

无回复( N)