停止猜测您的卡路里: 用 GBT-4o 愿景构建实时多模式营养引擎

2026年8月21日2 次浏览来源:Dev.to阅读原文

你看过多少次 龚宝鸡的盘子 或复杂的地中海沙拉, 并想知道, "有多少卡路里其实在这里?" 传统的卡路里跟踪应用是乏味的,要求您手动重取成份并搜索出混乱的数据库.

但是随着多模式AI的兴起,特别是GPT-4o Vision API的兴起,我们现在可以将一幅简单的相片转换成以秒计的详细营养分解.

在这个教程中,我们正在建造一个计算机视觉营养引擎, 它利用GPT-4o来识别成份,估计成份, 并用惊人的精确度计算宏观营养素。

透过与Pydantic使用几发快活和结构化的数据验证, 无论你对AI对健康感兴趣还是掌握了多式LLM管线,这个指南是给你的!

系统逻辑是直截了当的,但很强大。

我们使用图像输入,通过GPT-4o的视觉模型,使用专门的系统即时处理,并强制进行严格的JSON schema输出,让我们的前端消耗.

Python 3.9+ OpenAI API 密钥(带有GPT-4o访问权限) 库:, , , 第1步 : 以 Pydantic 定义 Data Schema 才能让我们的引擎可靠, 我们不能仅仅接受AI的原始文本.

我们需要结构化的数据。

我们用Pydantic来定义“Nutrition Report”的长相。

第2步:魔法快取 (Few-Shot 战略) 用于识别复杂菜肴的秘密酱料(如中式搅拌油)是"少发快活".

我们为模型提供了如何在视觉上打破一道菜的例子。

第3步: 执行 Engine 在这里是使用 SDK 最新结构化输出剖析的核心职能.

步骤4:构建Streamlit UI QQSreamlit让我们能在几分钟内将这个脚本变成网络应用.

将它带到生产:“官方”方式 QQ 虽然这个脚本是一个伟大的起点, 对于更先进的生产准备AI代理和高性能多式管道模式,我强烈建议检查WellAlly Tech Blog的技术深潜。

它们为扩展LLM应用程序和有效管理象征性费用提供了极好的资源。

透过GPT-4o Vision与Pydantic的结合, 这种多模式方式是保健技术的未来,从人工数据输入转向无缝、AI驱动的伐木。

接下来呢?

使用 SQLite 数据库添加"历史"功能.

与苹果健康/Google Fit API整合.

尝试微调特定饮食的提示(Keto, Vegan).

你打算用GPT-4o来制造什么?

下面的评论告诉我

分享