¿Cuánta precisión tiene el reconocimiento de alimentos con IA? Qué esperar
Publicado en abril de 2026
El registro de comidas por foto con IA es bastante más rápido que buscar a mano en una base de datos de alimentos. Pero una pregunta habitual antes de cambiar es: ¿cuánta precisión tiene en realidad? La respuesta honesta es que depende de lo que comas y de cómo lo fotografíes. Esto es lo que la tecnología puede y no puede hacer.
IA de reconocimiento de alimentos: cómo funciona la tecnología
La IA de reconocimiento de alimentos es visión por computador aplicada a un plato: un modelo entrenado con imágenes de comida etiquetadas que identifica lo que hay en una fotografía y estima cuánto hay. La misma clase de modelo impulsa las apps de calorías de consumo y las API comerciales de reconocimiento de alimentos sobre las que construyen restaurantes, hospitales y plataformas de salud. Toda implementación ejecuta las mismas cinco etapas.
- Detección. El modelo localiza las regiones de la imagen que contienen comida, separándolas del plato, la mesa y el fondo.
- Segmentación. Cada región de comida se divide en elementos distintos, de modo que un salteado pasa a ser proteína, verduras, arroz y salsa en lugar de un solo objeto.
- Clasificación. Cada segmento se compara con las categorías de alimentos con las que se entrenó el modelo. Esta es la etapa que ya es fiable: los modelos actuales reconocen miles de platos.
- Estimación de volumen y porción. El modelo deduce cuánto hay de cada elemento a partir de su tamaño aparente frente al plato, los cubiertos u otros objetos de referencia. Esta etapa, no la clasificación, es de donde procede casi todo el error.
- Consulta nutricional. Cada alimento identificado se ajusta a su porción estimada y se asocia a valores de calorías y macronutrientes.
Cuando haces una foto de una comida, un modelo de visión con IA analiza la imagen para identificar cada alimento. Se fija en las formas, los colores, las texturas y el contexto para determinar qué hay en el plato. Una vez identificados los alimentos, el sistema estima el tamaño de las raciones a partir de pistas visuales, incluido el tamaño aparente de cada elemento respecto al plato, los cubiertos u otros puntos de referencia del encuadre.
A partir de esas estimaciones, calcula las calorías y los macronutrientes usando los valores nutricionales de los alimentos identificados. Todo el proceso suele durar unos segundos.
¿Qué precisión tiene?
En comidas comunes y claramente visibles, el reconocimiento de alimentos con IA es razonablemente preciso. Un plato con una pechuga de pollo, arroz y verduras al vapor es el tipo de comida en la que la IA funciona bien. Los componentes individuales se ven, los tamaños de las porciones se pueden estimar y son alimentos que el modelo habrá visto muchas veces. Hasta qué punto acierta la estimación no es algo que nadie pueda reducir honestamente a un único porcentaje. La revisión sistemática de 2023 publicada en Annals of Medicine revisó 14,059 publicaciones, se quedó con 52 publicadas entre 2010 y 2023, y encontró errores relativos medios para las calorías que van del 0.1% al 38.3% entre ellas. Sus autores no pudieron combinar esos estudios en una sola cifra, porque las bases de datos de imágenes de alimentos y los resultados reportados variaban demasiado para un metaanálisis. Lo que la revisión sí establece es la dirección: los errores eran menores en imágenes de alimentos únicos o simples.
La precisión baja con los platos mixtos. Un guiso, una cazuela o un curri contienen ingredientes que quedan parcial o totalmente ocultos. La IA puede identificar qué plato es, pero no puede ver lo que lleva dentro, así que las estimaciones se apoyan más en recetas típicas que en lo que hay de verdad en tu olla. El margen de error se amplía.
Las salsas, los aceites y los aliños son sistemáticamente difíciles. Una ensalada aliñada con aceite de oliva y otra con una vinagreta ligera se ven casi idénticas en una foto. La diferencia de calorías entre ambas puede ser considerable. Los aceites de cocina añadidos a la sartén antes de saltear son completamente invisibles en la foto final.
Los alimentos envasados con etiqueta nutricional se gestionan mejor con la entrada manual o el escaneo del código de barras. Una ración de 200 g de un yogur de marca concreto tiene un perfil nutricional conocido y exacto. La estimación con IA introduce incertidumbre innecesaria cuando el dato real está impreso en el envase.
Qué afecta a la precisión
Hay varios factores prácticos que influyen en lo bien que funciona la IA con una foto concreta:
- Iluminación. Las fotos bien iluminadas dan al modelo más información visual con la que trabajar. Una iluminación pobre aplana las texturas y reduce la fidelidad del color, lo que dificulta identificar bien la comida.
- Ángulo. Las fotos cenitales (justo encima del plato) tienden a dar los mejores resultados. Los ángulos laterales pueden ocultar alimentos detrás de otros y hacer menos fiable la estimación de raciones.
- Disposición de la comida. Los alimentos repartidos por el plato en porciones distintas son más fáciles de analizar que las presentaciones apiladas o mezcladas. Si vas a comer varios elementos, separarlos antes de fotografiarlos ayuda.
- Objetos de referencia. Incluir el borde del plato, un tenedor u otro objeto conocido en el encuadre ayuda al modelo a calibrar el tamaño de la ración. Un trozo de pollo se percibe de forma muy distinta a escala junto a un tenedor que sin nada al lado.
Las comidas mixtas son más difíciles que los alimentos sueltos
Una pechuga de pollo a la plancha junto a arroz y brócoli son tres formas distintas con bordes claros. Un curri, un guiso, una cazuela o una ensalada aliñada son una sola masa visual en la que los componentes se solapan, se tapan entre sí y varían en densidad. La IA estima el segundo tipo con bastante menos precisión, y este es el mayor factor a la hora de predecir si una estimación por foto será acertada.
La revisión sistemática de 2023 en Annals of Medicine, que abarca 52 estudios publicados entre 2010 y 2023, encontró errores relativos medios en calorías de entre 0.10% y 38.3%, e informó de que los errores "tendían a ser menores en las imágenes de un solo alimento que en las de varios alimentos". Señala directamente el caso difícil: "las imágenes con platos mixtos (como los currys) o los platos con varios alimentos superpuestos de distintas alturas o con límites poco claros presentan mayor riesgo de errores de clasificación o segmentación". De los 22 errores más bajos de estimación de volumen entre los estudios revisados, el 68% procedía de imágenes de un solo alimento.
Un análisis de GPT-4V frente a comidas de referencia pesadas, publicado en IEEE Journal of Biomedical and Health Informatics en 2024, puso cifras a esa distancia. Al estimar un alimento cada vez, en 32 alimentos, el error absoluto medio de calorías fue de 69.2 kcal. Al estimar el episodio de comida completo, en 10 episodios, fue de 151.2 kcal, aproximadamente el doble. La causa es la acumulación: el tamaño de la porción es la fuente dominante de error, y un plato mixto exige un juicio de porción independiente para cada componente, cada uno con su propio error.
Esto no está del todo resuelto. Un estudio de 2025 en Nutrients que analizó 195 platos encontró solo una correlación débil entre el número de ingredientes y el error (r no superior a 0.37) y concluyó que el número de componentes no era determinante. El resumen honesto es que la separabilidad visual importa más que el número de ingredientes: un plato con seis alimentos claramente separados es más fácil que un bol con tres mezclados.
Qué significa esto en la práctica
- Fotografía antes de mezclar. Haz la foto de los componentes mientras siguen separados, no del bol ya removido.
- Divide una comida mixta en dos fotos siempre que puedas hacerlo con sentido. Dos estimaciones simples ganan a una estimación compuesta.
- Corrige la estimación en todo lo que esté triturado, con salsa o en capas. La grasa es el nutriente que más se subestima de forma sistemática en todos los estudios, y el aceite de una salsa es invisible en una foto.
- Trata los guisos y currys caseros como el peor caso, y regístralos a partir de los ingredientes en lugar de con una foto cuando la comida importe.
¿Comparado con qué?
La comparación útil no es la IA frente a una cifra perfecta, sino la IA frente a cómo registrarías esa comida de otro modo, que también es inexacto.
Un estudio de 2018 publicado en Nutrients pidió a 38 profesionales de la nutrición que estimaran porciones a partir de imágenes de comida. Solo el 23.7% de sus estimaciones de platos quedó dentro del 10% de la cantidad real pesada, con una diferencia porcentual absoluta media del 47.6%. El trabajo Nutrition5k presentado en CVPR 2021 realizó una comprobación humana más pequeña junto a su conjunto de datos de unos 5,000 platos: 4 nutricionistas y 16 aficionados evaluaron 10 platos elegidos por ser más simples que la media del conjunto de datos. Los nutricionistas promediaron un 41% de error y los aficionados un 53%. Interpreta eso como un orden de magnitud sobre una muestra favorable, no como una estimación poblacional.
El registro manual en una app tiene su propio sesgo, aunque menor de lo que sugiere la cifra principal. Un metaanálisis de 2021 en Advances in Nutrition que reúne 11 estudios de apps de registro dietético encontró que subestimaban la ingesta de energía en 202 kcal al día de media (IC del 95%: 319 a 85 kcal). La mayor parte de esa diferencia viene de la tabla de composición de alimentos y no del registro: cuando la app y el método de referencia usaban la misma tabla, el déficit conjunto bajó a 57 kcal al día (IC del 95%: de un déficit de 116 kcal a un excedente de 2 kcal) y la heterogeneidad entre estudios cayó a cero. En un día de 2,000 calorías eso es menos del 3%, así que la entrada manual cuidadosa contra una base de datos coincidente sí es el método más preciso.
Así que la estimación por foto de un plato mixto es imprecisa, y también lo es la de un dietista que mira ese mismo plato. La entrada manual cuidadosa gana a ambas en precisión, y pierde frente a ambas en si sigues haciéndola. Lo que cambia el registro por foto no es la precisión, sino si registras la comida o no, y una comida registrada con una estimación corregible gana a una sin registrar.
Desconfía de las afirmaciones sobre precisión
Varios sitios publican cifras de precisión que suenan muy exactas para las apps de calorías, algunos citando estudios y DOI que no existen. Ninguna app tiene una validación publicada y revisada por pares de su producto en el mercado. Cuando una cifra no lleva detrás una revista, un tamaño de muestra y una metodología, trátala como marketing. Eso nos incluye: las cifras de esta página se citan de investigación independiente, no de nuestras propias pruebas.
¿Basta con "lo bastante cerca"?
Para la mayoría de las personas, sí. Un margen de error de dos dígitos suena importante de forma aislada, pero el contexto importa.
Las entradas manuales de una base de datos tampoco son perfectamente precisas. Las bases de datos aportadas por usuarios contienen errores, las definiciones de ración varían entre fuentes y las comidas caseras rara vez coinciden con el método de preparación exacto que asume una entrada de la base de datos. La precisión práctica del registro manual para comida casera es menor de lo que la mayoría supone.
Más importante aún: para el seguimiento, la constancia importa más que la precisión. Si estás comparando registros basados en IA con aplicaciones tradicionales de base de datos, la comparativa entre VitaCal y MyFitnessPal cubre las diferencias prácticas en el enfoque de registro. Si la IA se desvía sistemáticamente un 15% en una comida concreta que tomas a menudo, tu ingesta registrada sigue reflejando tu ingesta real en términos relativos. Tus tendencias semanales, tus respuestas a los cambios en la dieta y tu progreso con el tiempo siguen siendo significativos. El objetivo del seguimiento es tomar conciencia e identificar patrones, no lograr una medición de laboratorio de cada comida.
Lo que rompe el seguimiento no es el margen de error. Lo que rompe el seguimiento es abandonar el hábito porque registrar es demasiado lento o cuesta demasiado esfuerzo. El registro por foto con IA ataca ese problema directamente.
Cómo obtener mejores resultados
Unos pocos hábitos sencillos mejorarán la calidad de las estimaciones de la IA:
- Revisa lo que ha identificado la IA antes de confirmar el registro. Si ha pasado por alto un ingrediente o ha identificado mal algo, puedes corregirlo antes de guardar.
- Haz las fotos desde justo arriba y con buena luz. Cuesta un segundo más y marca una diferencia medible.
- En las comidas donde la precisión importa, registra los componentes por separado en lugar de como un solo plato. Así el modelo tiene una tarea más limpia para cada elemento.
- Usa la entrada manual para alimentos envasados. Si hay etiqueta nutricional, úsala. Reserva el registro con IA para las comidas en las que tiene una ventaja real: comida cocinada, comida de restaurante y cualquier cosa que de otro modo tendrías que buscar.
El enfoque de VitaCal
Para ver cómo se compara el registro por foto entre las apps que lo ofrecen, consulta la guía de apps de contador de calorías con IA y reconocimiento de fotos.
VitaCal te muestra exactamente qué identificó la IA en tu foto antes de registrar nada. Puedes ver cada alimento, sus porciones estimadas y las calorías y macros resultantes. Si algo no cuadra, puedes ajustar porciones o quitar elementos antes de confirmar. No se registra nada sin tu revisión.
Si quieres ver cómo funciona el registro con IA en la práctica, prueba VitaCal gratis. El plan gratuito incluye cinco análisis con IA por semana sin anuncios.