Un concepto muy de moda últimamente y que según algunos analistas es una de las 5 tendencias de la próxima década: Mobile, Social, Cloud, Consumerization and Big Data
Big Data es, como su nombre indica, «Grandes Datos», es decir, análisis y procesamiento de grandes volúmenes de datos. Tan grandes que las actuales herramientas no serán capaces de procesar.
Big Data: Conjunto de técnicas y tecnologías que permiten almacenar y procesar ingentes cantidades de datos de una manera eficaz y eficiente.
Según IBM, se generan más de 2.5 quintillones de bytes al día, hasta el punto de que el 90% de los datos del mundo han sido creados durante los últimos dos años.
Estamos por tanto ante un gran reto en los próximos años.
No toda la información que se genera puede considerarse Big Data. Hay cuatro características principales que identifican qué tipo de datos pueden ser considerados Big Data:

- Cuando hablamos de volumen, nos referimos desde petabytes hacia arriba.
- Velocidad: casi en tiempo real
- Variedad de fuentes de información
- Valor añadido, ser capaces de descubrir patrones y predecir comportamientos futuros
Para situarnos en contexto:
- Kilobyte = 103 bytes
- Megabyte = 106 bytes
- Gigabyte = 109 bytes
- Terabyte = 1012 bytes
- Petabyte = 1015 bytes (1000 Teras)
- Exabyte = 1018 bytes (1 millón de Teras)
- Zettabyte = 1021 bytes (Mil Millones de Teras)
- Yottabyte = 1024 bytes (1 billón de teras)
Segun Cisco’s Visual Networking Index, para finales de 2016 el mundo habrá traspasado el umbral del zettabyte de datos transferidos a través de internet durante un año. Verdaderamente estos números dan vértigo (http://technografy.blogspot.com.es/2013/04/so-how-much-is-zettabyte-infographic.html)
Tradicionalmente los sistemas datawarehouse analizan los comportamientos pasados. El gran reto del Big Data es predecir el futuro.
Para el datawarehouse habitual se necesitan grandes infraestructuras, grandes servidores, grandes espacios acondicionados a medida, es muy costoso, pasa rápidamente de moda.
Big Data requiere una nueva infraestructura tecnológica.
En el proyecto opensource de apache han creado Hadoop (http://hadoop.apache.org/) , que permite usar hardware en modo «commodity», es decir, hardware barato que en vez de crecer «verticalmente» (+ procesadores + memoria + disco), crece horizontalmente (cluster de nodos), es decir, sumando nodos a medida que vayas necesitando mayor capacidad de almacenamiento y procesamiento.
Los grandes fabricantes también están apostando por el big data y creando nuevas distribuciones de hadoop orientadas al mundo empresarial. Otros proveedores como Amazon te permiten montar tu cluster de nodos en la nube con hardware de bajo coste.
Hadoop es un framework open source que permite desarrollar y ejecutar aplicaciones de procesamiento en paralelo de grandes cantidades de datos, tanto estructurados como no estructurados.

Está diseñado para funcionar desde pocos servidores a cientos, donde cada uno se encarga tanto del procesamiento como del almacenamiento.
Algunas soluciones haddop:
- Hadoop Common: acceso a los módulos de hadoop
- Hadoop Distributed File System (HDFSTM): sistema de archivos distribuido para el acceso a los datos
- Hadoop MapReduce (YARN): procesamiento en paralelo de grandes volúmenes de datos
- Otros componentes para la gestión de tareas y los recursos disponibles
Por último, algunas posibles aplicaciones del BigData:
- Fuga de Clientes: Predecir la probabilidad de que cualquier cliente pueda darse de baja en base a su comportamiento
- Mejorar la gestión de las campañas: Previsión de la demanda y mejorar el rendimiento de las campañas
- Modelización del riesgo: gestionar la exposición y ofrecer mejores productos a los clientes.
- Mejora de ventas y segmentación de clientes: aumentar los ingresos y mantener la solidez financiera








