我们都去过:看着一盘美味的面条, 手动跟踪是一种杂技,标准应用在部分估计时经常会失败.
但是,如果我们可以把计算机视野、多模式LLMs和矢量数据库结合起来,建立一个自动化的营养师呢?
在这个教程中,我们正在建立一个最先进的多式联运食品估计管道。
通过利用分层任意模式(SAM)进行精确的边界探测和GPT-4o视野进行上下文分析,我们可以弥合"看一张照片"和"计算营养密度"之间的差距.
无论是对AI驱动的好感,FastAPI开发,还是多式RAG感兴趣,本指南覆盖了全堆.
管线遵循精密的"识别->分析->匹配"流.
我们不只是问GPT-4o"这是什么?";我们使用SAM来隔离食物项目,首先确保LLM专注于正确的像素.
在潜入之前,请务必做好以下准备: Python 3.10+ OpenAI API key (for GPT-4o) PyTorch (for SAM) PostgreSQL 与扩展允许 FastAPI 为后端步骤1: 与 SAM QQ 的精准分解 食物AI的最大挑战是项目相重叠.
使用Meta的分块 Anything Model(SAM),我们可以提取食物项目的确切口罩,这有助于计算盘子上占据的相对"区域".
第2步:多模式分析与GPT-4o QQ 一旦我们得到分出图像,我们就将原始图像和口罩提示传递给GPT-4o.
我们请该模型担任烹饪专家,估计体积(克/毫升)并查明具体成分。
第3步:用RAG(pgvector)来关闭循环,QQLMS可以产生出卡路里幻觉.
为了确保准确性,我们从GPT-4o中取出,将其转换为嵌入式,并对PostgreSQL中储存的经核实的营养数据库进行类似性搜索。
Pro Tip:关于生产级的落实, 它们为专门领域的RAG管道的微调提供了极好的资源。
步骤4:构建快活API终点QQ 现在,让我们把所有的东西都包装成一个干净的高性能API.
为什么本作的QQ背景意识:与简单的分类器不同,GPT-4o通过查看周围物体(如叉子或玻璃)来理解"深度"和"尺度"来估计部分大小.
通过SAM的精度:通过分分食物,我们减少了背景噪声(桌子,餐巾),使得视觉模型可以完全专注于营养内容.
我们不相信LLM的数学 我们使用LLM来进行意图和识别,但我们使用我们自己的数据库来进行硬数字.
结论和下一步 建设多模式管道是管弦乐。
通过将SAM和GPT-4o的"眼"与矢量数据库的"记忆"结合起来,我们创造了一个比传统卡路里计数器更精确得多的工具.
接下来呢?
实施时间跟踪,以观察一周内饮食的变化。
添加OCR读取餐厅菜单并和盘子图像相参照.
如果你喜欢这栋楼 别忘了好好检查一下 技术/博客,用于更高级的AI集成和全库开发辅导.
快乐的编码