[功能/问题] 优化 Chat LLM 界面中的上下文窗口和 token 效率,以实现可视提取
作者: 24KaratAu创建于 2026年6月24日更新于 2026年6月24日
描述 我正在利用 PixelRAG 进行一个研究项目,该项目涉及导入大量动态的、使用 JavaScript 渲染的网站,并通过多模态聊天界面(例如 ChatGPT/Claude Web UI)对其进行分析。 尽管 pixelshot 在执行客户端 JS 和通过其 1568px 格式切片策略保持复杂布局结构完整性(如表格和数据图表)方面做得非常出色,但将这些视觉切片直接传递到 LLM 聊天界面会导致大量视觉令牌开销。
内容来源: StarTrail-org/PixelRAG