AI DAILY / 2026-09-08
25餐实测:主流LLM卡路里估算准确率对比
Benchmarking calories evaluation with LLMs
全文中文翻译 · AI 生成,仅供学习交流
用 LLM 评估卡路里:做个基准测试
想给自己整一个快速的卡路里计数器,用 LLM 看餐食图片加描述来估算热量。得挑模型,就顺手做了一轮基准。配置是这样。
- 餐食图片与卡路里数据来自 Nutrition5k(https://github.com/google-research-datasets/Nutrition5k)
- 一个能查 USDA FoodData Central 和 MEXT 卡路里数据的工具
- 评估标准看的是模型在多少份餐食上把误差压到 20% 以内
- 全部用同一组随机抽出的 25 份餐食
- 本机跑不动的模型走 OpenCode Go 或 OpenRouter
- Spark 1.3 也加进来了,据说它会开源权重
结果
| Model | % within 20% | Mean bias | Median Error |
| --- | --- | --- | --- | --- |
| Qwen 3.8 27b | 16% | +64 kcal | 148 kcal |
| GLM 5.3 Flash | 28% | +18 kcal | 65 kcal |
| Qwen 3.8 Max | 32% | -11 kcal | 48 kcal |
| Muse Glimmer 30b | 32% | +25 kcal | 92 kcal |
| Qwen 3.8 Flash | 36% | +2 kcal | 91 kcal |
| DeepSeek v4 Flash Vision | 40% | +52 kcal | 65 kcal |
| Muse Spark 1.3 | 48% | -24 kcal | 45kcal |
我也清楚这算不上多严谨的基准。不过有意思的是,排名跟模型大小基本不挂钩。我个人最感兴趣的是,Muse Glimmer 30b 在这里把 Qwen 3.8 27b 碾压了。这也说明,在消费级硬件(约 32Gb VRAM)上,所谓「最强」的模型到底是谁,真的很看任务。
submitted by /u/mr_tolkien [link] [comments]