¿Está muerta la visión por computadora clásica? Un análisis en la era del Deep Learning
La visión por computadora (computer vision) ha experimentado una transformación radical en los últimos años. El artículo de Ömer Günaydın publicado en diciembre del 2025, nos plantea una pregunta provocadora: ¿está muerta la visión por computadora clásica? Aunque el deep learning domina el campo con modelos potentes y hype constante, los métodos clásicos no han desaparecido. Siguen siendo esenciales para tareas simples, eficientes en recursos y fundamentales para entender los principios básicos de la disciplina.
En el año 2025 el debate entre enfoques clásicos y modernos basados en aprendizaje profundo es más vivo que nunca. Los modelos como Vision Transformers (ViT) y foundation models como Segment Anything Model (SAM) lideran las innovaciones, pero los algoritmos tradicionales de OpenCV persisten en aplicaciones reales donde el costo computacional o la explicabilidad son críticos.

¿Qué es la visión por computadora clásica?
La visión por computadora clásica se basa en algoritmos matemáticos y geométricos diseñados manualmente por ingenieros. No depende de grandes datasets ni entrenamiento neuronal, sino de reglas explícitas para procesar imágenes.
Ejemplos clave incluyen:
- Detección de bordes y líneas: Algoritmos como Canny Edge Detection y Hough Transform. Útiles para identificar contornos en imágenes estructuradas, como tableros de ajedrez o carreteras.
- Extracción de características: Detectores de keypoints como Harris Corner, FAST o Shi-Tomasi; descriptores como SIFT, SURF, ORB o BRIEF. Permiten matching entre imágenes para seguimiento de objetos.
- Filtros predictivos: Kalman Filter para predecir movimiento en videos.
- Sustracción de fondo: Métodos como MOG2 o KNN en OpenCV para detectar movimiento en cámaras fijas.
- Transformaciones: Corrección de perspectiva para alinear imágenes tomadas desde ángulos irregulares, mejorando OCR.
- Análisis de color: Filtrado por rangos HSV para contar objetos por color, como frutas en una cinta transportadora.
Estos métodos son determinísticos, rápidos y requieren poco poder computacional. En entornos embebidos o edge computing, brillan por su eficiencia.

El ascenso del Deep Learning y los modelos modernos.
Desde AlexNet en el año 2012, el deep learning revolucionó la visión por computadora. Redes convolucionales (CNN) como ResNet, luego Vision Transformers (ViT) y modelos multimodales como CLIP o SAM, aprenden características automáticamente de datos masivos.
Ventajas:
- Rendimiento superior en tareas complejas: clasificación, detección de objetos, segmentación semántica.
- Adaptabilidad: Modelos foundation como SAM3 segmentan cualquier objeto con prompts.
- Escalabilidad: Mejoran con más datos y compute.
En el 2025 las nuevas tendencias incluyen:
- Vision Transformers dominando benchmarks por su atención global.
- Modelos híbridos (convoluciones + transformers) como ConvNeXt.
- Generative AI para síntesis de datos y augmentación.
El hype es real: nuevas publicaciones semanales generan entusiasmo, atrayendo principiantes directamente al deep learning.

Comparación: Clásica vs. Moderna
| Aspecto | Clásica | Deep Learning/Moderna |
|---|---|---|
| Extracción de features | Manual (handcrafted) | Automática (aprendida) |
| Recursos | Bajo (CPU suficiente) | Alto (GPU/TPU necesaria) |
| Explicabilidad | Alta (reglas matemáticas) | Baja (caja negra) |
| Datos requeridos | Pocos o ninguno | Millones de imágenes etiquetadas |
| Rendimiento en tareas simples | Excelente y rápido | Sobredimensionado |
| Robustez a variaciones | Limitada (iluminación, ángulos) | Alta (con buen entrenamiento) |
| Aplicaciones ideales | Edge, real-time simple, SLAM | Clasificación compleja, autónomos |
Estudios muestran que en SLAM (Simultaneous Localization and Mapping) o Structure from Motion (SFM), métodos clásicos superan deep learning por elegancia matemática y bajo consumo.

¿Por qué parece “Muerta”?
El hype de modelos como SAM3 eclipsa lo clásico. Principiantes saltan directamente a PyTorch o TensorFlow, ignorando OpenCV. Publicaciones y cursos enfocan deep learning, ya que resuelve problemas “imposibles” antes.
Sin embargo expertos coinciden: no está muerta. En embedded systems, inspección industrial o cuando datos escasean, clásica prevalece. Híbridos combinan ambos: preprocessing clásico + modelo profundo.

El futuro: Híbridos y equilibrio.
En el año 2025 el futuro es híbrido. Vision Transformers lideran foundation models, pero clásica proporciona bases para interpretabilidad y eficiencia en edge AI.
Recomendaciones:
- Aprende ambos: Fundamentos clásicos para entender “por qué” funcionan modelos modernos.
- Usa clásico para prototipos rápidos o constraints de hardware.
- Deep para escalabilidad y complejidad.

La visión por computadora clásica no está muerta; evoluciona y complementa la revolución del deep learning. En un mundo de IA generativa, sus raíces matemáticas aseguran soluciones robustas y éticas.
Investigación de José R. Leonett

Fuentes:
- https://medium.com/@siromermer/classical-computer-vision-is-dead-2cc2ba6bb2b4
- https://venturebeat.com/ai/ten-years-in-deep-learning-changed-computer-vision-but-the-classical-elements-still-stand
- https://arxiv.org/pdf/1910.13796
- https://www.ultralytics.com/blog/everything-you-need-to-know-about-computer-vision-in-2025
- https://viso.ai/deep-learning/computer-vision-trends-2025/
- https://imagevision.ai/blog/inside-the-latest-computer-vision-models-in-2025/
- https://blog.roboflow.com/vision-transformers/
- https://maddevs.io/blog/computer-vision-algorithms-you-should-know/