Mostrando entradas con la etiqueta google. Mostrar todas las entradas
Mostrando entradas con la etiqueta google. Mostrar todas las entradas

sábado, octubre 31, 2009

Google es como Ikea...

sábado, octubre 31, 2009 por Martín


Durante las últimas semanas han coincidido los lanzamientos de una serie de productos por parte de Google. A diferencia de lo que sucede en otras ocasiones donde estos lanzamientos pasan más o menos sin pena ni gloria, en esta ocasión estos lanzamientos han causado bastante inquietud en la comunidad emprendedora. Por una parte tenemos el lanzamiento de Google Maps Navigation que ha demostrado la parte más temible de Google y que es la capacidad de hundir las acciones de empresas a priori sólidas como TomTom o Garmin simplemente con un anuncio.

Poco después Google agitó el mercado emprendedor español, donde tanto abundan los comparadores de todo tipo, lanzando un comparador de hipotecas, que parece ser que será el primero de una serie de comparadores. Otros dos servicios que causan enorme inquietud en los emprendedores españoles, y me imagino que internacionales, son Google Music y Google Books.

El año que viene, Ikea abre en La Coruña. Todas las tiendas de muebles de la ciudad y alrededores están acongojadas. Ya sabéis, es el "El año que viene llega Ikea, vamos a cerrar la mitad". Más o menos como con los libros, la música, la salud, el gps, los comparadores o cualquier otra cosa sobre la que Google lanza un proyecto. Al fin y al cabo, Ikea es tan grande, tan todopoderosa, tan "fashion", tan barata, tan todo, que no se nos puede ocurrir como alguien podría no comprar en Ikea.

Pues bien, que me perdonen los fans de Ikea que sé que hay muchos, pero a mi no me gustan los muebles de Ikea, y como a mi a muchos otros. Lo primero es que Ikea no es precisamente barato. A ver, me corrijo, porque en Ikea hay cosas baratísimas, pero claro, la calidad de estas cosas está en niveles de bajo cero. A no ser que te guste sentarte en dos bandas de espuma baratas grapadas a unas placa de aglomerado sin cubrir de 1 cm. de espesor. Vamos, que los sofas y mesas de un piso en el que vivimos y que eran de Ikea se levantaban con una mano. Eso sí, un sofá 80 euros. Poco duró en casa, evidentemente.

Hace unos años Ikea abrió en Oviedo. La gente estaba loca por ir. De hecho, aún hoy hay mucha gente que va desde Galicia hasta allí a comprar. Las tiendas de muebles de la zona estaban en modo pánico, porque además Asturias siempre ha sido la zona del norte de España más proclive en lo que respecta a la fabricación de mueble. Pues bien, hoy en día, tras unos años de Ikea operando, si les preguntas a aquellos que estaban aterrorizados por la llegada de Ikea te dirán "¿Ikea? Bah, esos nada. Vendemos nosotros más que ellos".

Evidentemente, no es cierto, porque Ikea factura millones. Pero lo que sí que es cierto es que las ventas de las tiendas y fábricantes han aumentando, lejos de disminuir como se vaticinaba antes de la llegada del gigante sueco. ¿Por qué? Pues porque Ikea lejos de ser un depredador de mercado ha venido a ser un catalizador de las ventas de otras fábricas y tiendas tradicionales. El público de las mueblerías tradicionales no es el público de Ikea. A Ikea se va a por mueble barato, "que de el pego", y esa gente ya no te iba a una mueblería tradicional, sino a outlets. Y los clientes de siempre que se compran algo en Ikea, la mayoría encuentran que los muebles buenos son carísimos, y que si compran los baratos pues los tienen que cambiar a los pocos meses ya sea porque se desmontan, porque no aguantan las embestidas de los niños o porque se les ha ocurrido mirar como están hechos y se han asustado.

Y tras este super rollo, engancho las dos historias :) ¿Alguien se acuerda de jaiku, google catalog, google notebook, google bookmarks, google mashup, etc.? Incluso proyectos gomo google health, Google Scholar, Google Blog Search... ¿alguien los usa? Bueno el Google Health lo dudo la verdad. El Blog search yo lo uso, pero tan de vez en cuando. Otro más, Google Reader. Yo lo uso pero cambiaría sin problemas. ¿Google App Engine? Iba a revolucionar el hosting, y tras tantas caidas y fallos ya da miedo usarlo, ahí no me cogen ni de broma. Muchos de estos proyectos tienen sus usuarios, pero no dejan de ser usuarios que buscan algo gratis (i.e. que ya no iban a comprar tu servicio de ningún modo) o que ni se molestan en buscar alternativas mejores, simplemente lo escogen porque es más sencillo. Pues lo mismo que hacemos muchos con Google Docs, y que no se te ocurra hacer una hoja de cálculo seria con Google Docs porque después te va a dar la risa. ¿Google Wave? Visto lo que dice la gente, ni creo que lo pruebe.

Así que si nuestro producto es bueno, diferenciador, sí ofrecemos algo de calidad, sí tenemos nuestro grupo de fieles clientes contentos con la atención que les prestamos, pues yo creo que no habría nada que temer por mucho que Google entrase en nuestro nicho de mercado. Al contrario. Google trae mucho más atención al sector, publicidad, crea competencia, nos obliga a mejorar nuestro servicio y la atención que le prestamos al cliente, y en definitiva redunda en mejorar nuestro producto.

Sin más, y para cerrar desde este modestísimo espacio, no me queda más que apelar a la tranquilidad, que el tener a Google en el mercado muchas veces trae beneficios que dolores de cabeza (a no ser que cotizes en bolsa) , y que si nuestra oferta es lo suficientemente buena seguro que no hay Google que nos tosa :)

lunes, junio 08, 2009

Charlas de Google I/O online

lunes, junio 08, 2009 por Martín

Nota rápida por si a alguien le interesa. Muchas de las charlas de la conferencia Google I/O están ya disponibles para verlas desde la red.

Algunas tienen nombres prometedores como The myth of the Genius Programmer o Even Faster Websites. Hay un montón sobre AppEngine, algunas sobre Google Wave, y nada GWT, Google Friend, Androit y todas estas cosas.

Ya contaréis si alguna en especial vale la pena.

domingo, diciembre 14, 2008

Google publica un libro para desarrolladores sobre seguridad en navegadores web

domingo, diciembre 14, 2008 por Martín



Últimamente Google ha estado cogiendo algo de mala fama por reusar contenido libre, atacar todos los frentes posibles, pero no devolver nada a la comunidad. Pues bueno me entero via ReadWriteWeb de que acaban de publicar un libro titulado Browser Security Handbook bajo licencia Creative Commons 3.0.

El autor del libro es Michael Zalewski y su contenido está principalmente orientado hacia desarrolladores web. El libro consta de tres partes, la primera comenta los fundamentos de los navegadores web en cuanto a gestión de URLs, soporte de JavaScript, CSS, ett. La segunda parte trata sobre la seguridad en los navegadores web y procede a comentar diferentes mecanismos y los compara para diferentes navegadores; por último, la tercera parte comenta algunos sistemas experimentales de seguridad y características especificas de algunos navegadores web como Internet Explorer o Mozilla.

Parece un libro a tener en cuenta. Si os interesa el tema, y no lo habéis hecho ya, pasaros también por mis posts sobre OWASP que contienen entradas con información similar.

viernes, agosto 08, 2008

Usando Google (y Yahoo) como CDN para tu código JavaScript

viernes, agosto 08, 2008 por Martín


La número dos de las trece reglas para conseguir páginas web más rápidas (según Yahoo) es utilizar una CDN (Content Delivery Network). Ahora bien, las CDN cuestan dinero y quizás con nuestro modesto presupuesto no nos podamos permitir ningún gasto extra más.

Pues bien, en High Scalability publican un truco muy interesante, que básicamente consiste en utilizar el servicio gratuito de Google de hosting de librerías JavaScript. Se trata del proyecto AJAX Libraries API y hasta el momento alojan jQuery, jQuery UI, prototype, script.aculo.us, MooTools, y dojo.

Usar este servicio en nuestras páginas web es tan sencillo como referenciar a sus ficheros JavaScript:


<script src="http://ajax.googleapis.com/ajax/libs/prototype...
.../1.6.0.2/prototype.js"/>

Por su parte, Yahoo también ofrece hosting para su propia librería, YUI, como se muestra en este artículo.

El único problema que tendremos es que si el servicio de hosting de Yahoo o Google no son accesibles, por cualuier razón, nuestra librería no estará accesible, y por consiguiente es probable que nuestra aplicación no funcione. Aunque bueno, ya se sabe que aunque caerse se caen, su disponibilidad suele ser bastante alta, por lo que parece muy útil el ahorrarnos unas cuantas peticiones HTTP en nuestros servidores y pasárselas a los peces gordos:)

lunes, julio 28, 2008

Cuil, ¿amenaza para Google?

lunes, julio 28, 2008 por Martín


Comentan en SiliconRepublic que Tom Costello, un irlandés graduado por el Trinity College, y su esposa ex-empleada de Google, acaban de lanzar hoy mismo un buscador que aparentemente es una amenaza real para Google. Se trata de Cuil cuya principal vaza para amenazar la hegemonía de Google es la de indexar el contenido de las páginas web y no sólo la lista de keywords.

Como destacan en la noticia de SiliconRepublic, Cuil no es el primero en intentar amenazar a Google. Wikia ya lo intentó a principios de año pero fracasó estrepitósamente, especialmente debido a todo el hype que se había creado en torno a este buscador. Ya que no es sólo que no funcionara bien, sino que la disponibilidad era irrisoria debido al masivo número de visitas que recibían. En eso parece que han estado listos los chicos de Cuil ya que al menos yo no me he enterado de que existía, y en caso de enterarme habría sido una muy mala señal porque a mi estas noticias me llegan más bien de rebote.

Bueno, el caso es que a pesar de haber hecho bien, parece que todavía tendrán que afinar un poquillo con las búsquedas. Puestos a buscar, porque no agrandar el ego de uno mismo y buscarse en Cuil, así que me dispuse a buscar "Martin Perez". Y no sé, me da que o bien el algoritmo de enlazar imágenes con resultados no está bien, o bien lo están mostrando al azar, pero lo que está más claro que el agua (al menos para mi) es que este no soy yo:



Perdonando este lapsus, parece que la interfaz de usuario al menos es innovadora, y los chicos tienen 24 millones de dólares para mejorar, así que a ver si se crea un poquillo de competencia en la web que empieza a aburrir un poco.

martes, julio 08, 2008

¿Es Google el nuevo malo de la película?

martes, julio 08, 2008 por Martín


En este blog hay bastantes entradas sobre Google, probablemente como en la mayoría de blogs sobre informática. Esta compañía ha aportado tanto a la informática y es tan, tan, tan poderosa que es casi imposible el dejar de hablar de ella. Pero como suele pasar en estas compañías, a medida que van ganando poder, van perdiendo simpatizantes, y Google no es una excepción.

Greg Linden comenta en su blog que lo mismo pasaba con Amazon cuando él trabajaba allí, allá por el 2000, y muestra diferentes referencias a artículos de prensa atacando a Google, todos bastante recientes, incluyendo uno de hace un par de días donde en el New York Times presentan a Google como una especie de tirano más preocupado en ahorrar costes (¿qué raro en una empresa, no?) que de mantener los actuales beneficios de sus empleados.

El caso es que normalmente esto no me llamaría la atención, si no fuese que justamente este fin de semana, cuarioseando en boards.ie (que son unos foros realmente importantes en Irlanda, hasta el punto de ser referenciados en la radio o de que profesionales de diferentes tipos ofrecen consultas grauitas en los mismos ) me encontré un hilo sobre trabajo donde gente que trabaja en Google da sus impresiones, tanto positivas como negativas, aunque parece que predominan estas últimas. Como sabéis, Google tiene los cuarteles generales en Europa localizados en Dublin

Esta opinión es realmente interesante, y muestra (si asumimos que es real) las fuertes diferencias entre puestos técnicos y no técnicos en la compañía. Otros hilos hablan de la enorme competencia dentro de la empresa, la importancia de relacionarse, y en resumen muchas cosas lejos de la imagen idealizada que pudiese tener mucha gente de la compañía. Pero ojo, no os quedéis sólo con lo malo porque también hay opiniones buenas, y los beneficios que se obtienen trabajando en Google son únicos (aunque por ahora no sea más en forma de acciones).

¿Qué os parece a vosotros? "An average large company", ¿como comentan por ahí? Sea como sea seguro que merece la pena trabajar ahí aunque sólo sea un tiempo para aprender de la experiencia.

sábado, junio 21, 2008

Charlas de escalabilidad en Google, 2008

sábado, junio 21, 2008 por Martín



El año pasado hice un par de referencia a las conferencias de escalabilidad que celebraba Google en Seattle en el 2007.

Este año las han vuelto a repetir. Fueron exactamente hace una semana y los videos ya están disponibles en YouTube por si a alguien le interesa echarles un vistazo.

lunes, abril 14, 2008

Amazon reacciona. Habrá por fin almacenamiento persistente para EC2

lunes, abril 14, 2008 por Martín


Google lanza Google App Engine la pasada semana y todo el mundo se vuelve loco y ruegan que soporten sus lenguajes. Estaba claro que esto era un golpe importante para Amazon ya que parte de su base de usuarios irremediablemente se fugará a un servicio como el de Google, que es gratuito.

Amazon tenía que reaccionar. Y parece que lo ha hecho, aunque por ahora únicamente en forma de anuncio. Werner Vogels anunciaba ayer en su blog que Amazon ofrecerá en breve almacenamiento persistente como parte de sus servicios. La nueva funcionalidad permitirá crear volúmenes de almacenamiento persistente que variarán desde 1Gb hasta 1Tb de datos. Los volúmenes se podrán montar en cualquier instancia de EC2 y básicamente se comportarán como discos sin formato sobre los que se podrá instalar cualquier sistema de ficheros. Los volúmenes serán accesibles localmente dentro la zona de accesibilidad sobre la que hayan sido desplegados.

A mayores de esto, Amazon también ofrecerá la posibilidad de crear snapshots de modo que se pueda almacenar una imagen de cualquier sistema de ficheros en Amazon S3. La idea es que esto puede servir para replicar el sistema de ficheros en múltiples zonas de accesibilidad para construir aplicaciones geo-scalables. En el blog de Amazon Web Services ofrecen más información sobre el nuevo almacenamiento persistente para EC2.

Amazon anunció el pasado mes el lanzamiento de zonas de disponibilidad y IPs elásticas. Ahora reacciona con almacenamiento persistente para EC2. Y es que está claro que no hay nada como tener algo de competencia para dinamizar el mercado. Al final creo que los beneficiados somos nosotros, y la verdad es que ya dan ganas de que entren más compañías como Google en serio en el mercado del cloud computing.

domingo, abril 13, 2008

El mapa de los centros de datos de google

domingo, abril 13, 2008 por Martín


DataCenterKnowledge publicó hace unas semanas una listas con las localizaciones de los diferentes centros de datos de Google. En Pingdom se han hecho eco de esa noticia y han trasladado toda esa información a un mapa de Google Maps que podéis visualizar desde Wayfaring. El mapa deja bastante claro cuales son sus mercados principales en la actualidad.



jueves, abril 10, 2008

¿Cuál será el próximo lenguaje soportado por Google App Engine?

jueves, abril 10, 2008 por Martín


Sin duda, la noticia de la semana es Google App Engine. Con todo lo que se ha hablado sobre esta iniciativa, poco más se puede añadir. En inglés probablemente la mejor revisión es la de InfoQ, y en español me quedo con la de Aitor.

Lo que me ha hecho gracia hoy es que visitando diferentes foros, parece que hay una guerra entre los fans de Ruby y los fans de Java para intentar presionar por ser el siguiente lenguaje en ser soportado por Google. Y es que está bastante claro que si Google ofrece hosting gratuito en forma de cloud para cualquiera de estas plataformas, cualquiera de ellas cogerá una enorme tracción. Mientras escribo esto, Ruby tiene 87 puntos y Java 83, así que la pelea está bastante apretada.

Así que Javeros y Raileros, hagan sus votos. Eso sí, en la lista de peticiones para lenguajes, por ahora gana Perl :-).

domingo, enero 20, 2008

¿Es MapReduce un paso atrás?

domingo, enero 20, 2008 por Martín

La gripe que inevitablemente estoy incubando sumado a que llevo unos días un poco desconectado debido al esfuerzo de arrancar algo del que probablemente pronto tengáis noticia y que me tiene muy ilusionado, me ha hecho mantenerme un poco apartado del blog estos días y también de las noticias blogosféricas. Y claro, hoy al ir repasando mis feeds me he encontrado con el tremendo lio que se ha montado debido al último artículo de Michael Stonebraker: MapReduce: A major step backwards.

StoneBraker es una referencia dentro del mundo de la base de datos. Recientemente, uno de sus artículos tubo enorme aceptación al cuestionarse si las bases de datos relacionales habían quedado obsoletas en un mundo en el que las bases de datos especializadas tenían cada vez más éxito. Sin embargo, parece que ahora ha dado con un hueso muy duro de roer con la comunidad de la computación distribuida.

StoneBraker afirma en su artículo que MapReduce es un enorme paso atrás en la computación distribuida, en base a los siguientes argumentos:
  • Representación de datos anticuada. No aprovecha los conocimientos adquiridos en los últimos años y las ventajas de utilizar esquemas y lenguajes de acceso a datos de alto nivel.
  • Una aproximación menos que óptima basada en fuerza bruta.
  • Nada nuevo, ya existía hace 25 años.
  • Adolece de la falta de la mayor parte de funcionalidades disponibles dentro de las bases de datos relacionales.
  • Es incompatible con todas las herramientas disponibles para bases de datos, es decir generadores de informes, herramientas de BI, data mining, data warehousing, etc.


Prácticamente todos los medios de noticias y bloggers están de acuerdo en que StoneBraker ha cometido un error muy básico, que es comparar peras con naranjas, bases de datos con algoritmos de computación distribuida.

Hay quien trata de exponer todos los errores del artículo y opina que los autores (David J. DeWitt es coautor) es que los autores se han despistado y que si en lugar de hablar de MapReduce hubiesen hablado de Amazon SimpleDB el artículo hubiera tenido sentido. Hay también es más drástico y opina que StoneBraker ya no es una referencia para él.

Hay quien también apunta que el propio Google es consciente que el algoritmo no es lo mejor que podría ser pero que cumple su objetivo perfectamente. Otras comunidades y blogs como High Scalability, InfoQ o YComb se han hecho también eco del tema.

Lo cierto es que a mi también me ha chocado bastante la comparación entre MapReduce y una base de datos. Leyendo el artículo, la verdad es que uno sigue el hilo y hasta puede estar de acuerdo en algún punto de los puntos uno, y dos; pero es en los siguientes puntos, tres, cuatro y cinco, donde el artículo pierde definitivamente el norte.

A mi me da la impresión de como si durante estos años un montón de gente hubiese acudido a estas personas con preguntas del estilo "¿Por qué necesito una base de datos si Google no la usa?", "¿Tienen alguna base de datos como BigTable?", "¿Por qué va Google tan rápido sin base de datos y la que ústedes nos han recomendado va tan lenta?", y se hayan querido despachar a gusto. Realmente me suena a esto. A un "estamos hartos de tantos emails sobre BigTable y vamos a dejar las cosas claras".

En fin, la verdad es que los que nos manejamos a niveles muchísimo más modestos, pues por lo menos podemos intentar aprovechar estos lios para pillar un poco de aquí y otro poco de allá en los comentarios y aprender los entresijos de algunas tecnologías. Que al final es lo que vamos a sacar en limpio :-)

viernes, enero 11, 2008

Más sobre MapReduce

viernes, enero 11, 2008 por Martín

Dándole un repaso a los blogs de escalabilidad que hay en inglés parece que estos días le han estado dando una vuelta de tuerca más al tema de MapReduce. Todo se debe a la publicación en ACM Computing de una nueva versión del artículo sobre MapReduce publicado en el 2004 por Jeffrey Dean y Sanjay Ghemawat. El artículo es de pago pero hay quien lo publica en su blog.

El artículo es muy similar a la versión original. Prácticamente un clon pero mejor formateado y más legible. A mayores incluye nuevas estadísticas sobre el uso de MapReduce en Google durante estos últimos años, que es lo realmente interesante si ya habíais leido el artículo original.



Según se puede leer en el artículo la primera versión estable de MapReduce se publicó en Febrero del 2003 aunque fue ampliamente mejorada en Agosto también del 2003. A día de hoy los autores comentan que se han implementado unos 10.000 programas distintos (aunque en las estadísticas sólo dan unos 6000 sumando implementaciones de map y reduce). Se ejecutan unos 100.000 trabajos de media utilizando este framework que procesan unos 20 petabytes al día. Muy impresionante, desde luego.

Entre las aplicaciones que usan MapReduce, están las que ya comentaron en su momento: problemas de machine learning, froogle y Google News, Google zeitgeist, y alguna otra. Han añadido a mayores Google Trends, el procesado de imágenes por satélite (asumo Google Earth y Google Maps), y el procesado de modelos de lenguaje para traducción (Google Translator?).

Lo más jugoso es la tabla resumen que muestran en el artículo:



Si queréis ampliar conocimientos sobre MapReduce y toda la infraestructura de computación de Google, probablemente el mejor recurso es el curso sobre sistemas distribuidos que se puede encontrar en Google Code, donde hay mucho material interesante.

También puede que sea interesante (no lo he visto) el video sobre MapReduce en sistemas multicore que publicaron en Febrero del año pasado y del que también está disponible la publicación original.

domingo, enero 06, 2008

Granjas, fábricas y nubes, el futuro de la computación

domingo, enero 06, 2008 por Martín

Según Julio Guijarro y Steve Loughan ambos miembros del grupo de investigación que tiene HP en Bristol ese es el futuro de la computación distribuida. Julio y Steve han publicado el pasado Diciembre una presentación muy interesante en la que hablan de como los modelos de servidor único y de un cluster de servidores han quedado obsoletos en favor de un modelo de granja con cientos de servidores donde el sistema de ficheros es distribuido y el almacenamiento y la CPU se alquila. Se trata de una infraestructura ágil, como ellos la denominan, y que tenderá en el futuro a una gran fábrica de grids con decenas de miles de servidores



Esta evolución se sustenta en la base de que las arquitecturas actuales han anulado ciertas asunciones que en el pasado eran verdaderas pero que Julio y Steve afirman que ya no lo son. Pongo la lista a continuación ya que aunque es posible que no se esté de acuerdo de todo me parece un buen resumen sobre las consecuencias arquitectónicas que tienen algunas tendencias actuales.

Arquitectura: Virtualización. Asunciones que ya no son ciertas:

  • Los sistemas permanecen activos por enormes espacios de tiempo.

  • Crear un nuevo sistema es caro y lento.

  • Duplicar un sistema existente es algo muy caro.

  • Los sistemas deben controlarse manualmente.

  • Los relojes están sincronizados.

  • La RAM nunca se "swappea".

  • Las máquinas que están en ejecución no pueden ser movidas y/o clonadas.


Arquitectura: Granjas de servidores. Asunciones que ya no son ciertas:

  • El fallo en un sistema es un evento inusual.

  • El 100% de disponibilidad se puede conseguir.

  • Los datos siempre están cerca del servidor.

  • Se necesita acceso físico al servidor.

  • Las bases de datos son la mejor forma de almacenamiento.

  • Necesitas tener millones de euros para ser un competidor en tu rama.


Arquitectura: Map/Reduce. Asunciones que ya no son ciertas:

  • Es difícil trabajar con terabytes de datos.

  • El código se ejecuta siempre en una única máquina.

  • El código ejecutado secuencialmente es mejor que el código ejecutado en paralelo.

  • La mejor forma para almacenar los datos es con sistemas RAID.

  • Las bases de datos son mejores que los sistemas de ficheros.


Arquitectura: Sharding. Asunciones que ya no son ciertas:

  • Una única granja puede escalar hasta el infinito.

  • Necesitas proporcionar 100% de disponibilidad al 100% de tus usuarios.

  • Cambios en la aplicación cambian la totalidad del esquema de base de datos.


El análisis realizado me ha parecido muy interesante. El argumento central de la presentación es que la computación poco a poco se está conviertiendo en una commodity, como las granjas que nos preparan la comida o las fábricas que nos hacen la ropa.

Sistemas sobre los que he estado hablando continuamente en los últimos meses, como S3, EC2, la nueva SimpleDB o Hadoop han cambiado la forma de entender la computación distribuida y, concretando en el caso de Amazon, proponen un modelo de renting muy atractivo que permite a pequeñas startups ponerse a la altura de grandes corporaciones.

Por cierto, que no lo había comentado, Julio Guijarro es el líder del proyecto SmartFrog, que personalmente no conocía y que tiene como objetivo el proporcionar una tecnología que describa sistemas de software distribuidos como colecciones de componentes manejables y activables. Por la descripción se me antoja como algo similar a Dryad de Microsoft. Eso sí, éste está liberado bajo licencia LGPL.

martes, noviembre 13, 2007

Dryad, la alternativa a MapReduce de Microsoft

martes, noviembre 13, 2007 por Martín

En un comentario a la entrada anterior sobre GigaSpaces, Diego apunta que las arquitecturas existentes para trabajo en grid son todavía insuficientes por ser demasiado explícitas obligando a las compañías a invertir mucho tiempo en gestionar algoritmos de computación distribuida.

Parece que lo mismo pensaron en Microsoft cuando estaban diseñando Dryad, una abstracción creada sobre los fundamentos del álgebra relacional y el algoritmo Map and Reduce de Google y que permite la ejecución distribuida de grafos de trabajos en clusters. Ellos explican mejor lo que hace:


Dryad is quite expressive. It completely subsumes other computation frameworks, such as Google's map-reduce, or the relational algebra. Moreover, Dryad handles job creation and management, resource management, job monitoring and visualization, fault tolerance, re-execution, scheduling, and accounting.


La idea del framework es que el programador se dedique simplemente a preparar el grafo de trabajos y que el cluster Dryad haga el resto. Lo interesantes de Dryad son las abstracciones que ofrece. Parece que es capaz por ejemplo de ejecutar el mismo trabajo en varios nodos y quedarse con la salida del que acaba más rápido, o reejecutar un trabajo si se produce algún error, etc. Uno de los ejemplos que ponen es como integraron Dryad con SQLServer para ejecutar los planes de las queries de manera distribuida en un cluster Dryad.

Michael Isard de Microsoft Research dio una charla en Google bastante interesante y en la que explica como funciona el framework. Por cierto, no deja de ser curioso esto de que los ingenieros de Microsoft den charlas en Google :)

Si os interesa entrar en más detalle también tienen esta publicación: Dryad: Distributed Data-Parallel Programs from Sequential Building Blocks

martes, noviembre 06, 2007

OpenSocial, ¿lanzamiento prematuro?

martes, noviembre 06, 2007 por Martín

Tras el anuncio de OpenSocial y los primeros alagos no han tardado en aparecer las críticas debido a la falta de seguridad de la API. Techcrunch ya anunciaba que habían hackeado la primera aplicación en 45 minutos, y hoy vuelven a anunciar otro hack más.

En un artículo en RegDeveloper critican también la falta de seguridad de la plataforma y citan para ello varias referencias, además de citar a la plataforma OpenQabal que pretende hacer lo mismo que OpenSocial y que ya había sido anunciada con anterioridad aunque evidentemente sin el mismo impacto publicitario.

A veces los lanzamientos dirigidos por acciones de la competencia (se rumorea que el lanzamiento de OpenSocial se ha acelerado debido al golpe de efecto de Microsoft con Facebook) pueden salir mal. ¿Será el caso de Google? Yo no lo sé, pero me da a mi que Google está por encima del bien y del mal en cuanto a todo esto.

lunes, septiembre 24, 2007

Google rebaja la latencia bajo el agua

lunes, septiembre 24, 2007 por Martín

Según se puede leer en alguna web parece que Google ha confirmado este mes en una conferencia celebrada en Singapur que planea el lanzamiento en el 2009 de un cable multi-terabit que cruzará el pacífico y unirá Asia con América.

Todo ello para sacar ventaja sobre rivales como Yahoo o MSN. Da vertigo el imaginar lo importante que puede ser el mercado de los búscadores cuando estas empresas se permiten gastar millonadas en conseguir el canal más rápido posible, aunque sea cruzando océanos.

Que bien nos vendría a nosotros un cablecillo como esos para llegar hasta Nueva Zelanda, pero eso ya es otra historia...

martes, agosto 07, 2007

Hadoop toma protagonismo

martes, agosto 07, 2007 por Martín

Parece que uno de los proyectos que han tenido bastante éxito en la OSCON 2007 ha sido Hadoop, un subproyecto de Apache Lucene que implementa el conocido algoritmo de MapReduce utilizando su propio sistema de ficheros distribuido.

Tim O'Reilly ha publicado un extenso artículo sobre esta librería y la importancia de que Yahoo esté detrás de ella. En particular destaca la importancia de que Yahoo escoja el camino de contribuir al Open Source y respaldar proyectos exitosos como Lucene como base para las herramientas que utiliza, en lugar de seguir el camino de hacer desarrollos internos, que es el aparente camino que sigue Google (no quita que haya liberado interesantes frameworks).

Aún así el creador de Lucene y Hadoop, y ahora empleado de Yahoo, Doug Cutting, destaca que Hadoop no está limitado a la búsqueda ni tiene porque ser ese el escenario en el que rinde mejor:


"Where Hadoop really shines, is in data exploration." Many problems, including tuning ad systems, personalization, learning what users need -- and for that matter, corporate or government data mining -- involve finding signal in a lot of noise.


Y el artículo termina con un ejemplo de como utilizar MapReduce para afrontar la explotación de ficheros de log gigantescos.

El caso es que en la Yahoo Developer Network han publicado las charlas, powerpoints, video y audio de la presentación realizada en la OSCON y una entrada antes también hablan sobre la evolución del proyecto.

High Availability ofrecía un análisis hace poco sobre este producto. Y bueno, en casi todas estas fuentes referencian al artículo de Julio sobre como integrar Hadoop con Amazon Web Services.

Desde luego, parece que suena bastante. Por cierto, ¿a alguien le interesa jugar con Hadoop y Amazon? Un proyecto realmente interesante sería integrarlo con Apache Jackrabbit de forma que pudieses almacenar contenido de cualquier repositorio en un sistema de ficheros distribuido, como por ejemplo el de Hadoop, y que a su vez se volcase en un servicio como Amazon S3. Y además sería una contribución espectacular para jLibrary :D

miércoles, julio 25, 2007

Google nos protege de los malvados Singleton

miércoles, julio 25, 2007 por Martín

Un Singleton es un patrón de diseño muy popular por su sencillez. Como seguro que casi todos ya sabéis, la idea que promueve es que sólo se pueda crear una única instancia de una clase. A pesar de la aparente sencillez, la realidad es que implementar un Singleton no es algo tan sencillo, especialmente cuando entran en juego temas de sistemas distribuidos, diferentes classloaders, bla bla bla... En fin, que como con casi todo lo polémico pues hay seguidores y detractores.

Como en Google creen que los Singleton son una cosa muy importante, pues han tenido la gentileza de crear y hacer Open Source el Google Singleton Detector. Sí, con Google delante, para que no se espante. Una herramienta para detectar Singletons en nuestro código. Además, no sólo detecta Singletons, sino que también Hingletons (helper singleton), Mingletons (method singleton) y Fingleton (field singleton).

En el trabajo bromeabamos con que esto del 20% de tiempo para proyectos propios parece que da para mucho. Uno se pregunta por que en lugar de crear un proyecto tan concreto, por qué no habrán contribuido a algo mucho más conocido como Findbugs.

martes, julio 24, 2007

Más charlas de escalabilidad en Google

martes, julio 24, 2007 por Martín

Hace unas dos semanas ya publicaba un post haciendo referencia a algunas charlas de escalabilidad de la Google Conference on Scalability.

El caso es que hay más, y aunque algunos ya os habréis dado cuenta, dejo aquí los enlaces para completar la serie.

No creo que las vaya a ver todas así que ya comentaréis si hay alguna especialmente recomendable.

martes, junio 26, 2007

Google se desmarca de la virtualización

martes, junio 26, 2007 por Martín

Hoy va de DataCenters. En un artículo muy interesante en TheRegister, Luiz André Barroso de Google realiza diferentes afirmaciones en las que prácticamente desprecia todo lo relacionado con la virtualización, siéndo el siguiente probablemente el párrafo más llamativo:


"I think it will be very sad if we need to use virtualization," he said. "It is hard to claim we will never use it, but we don't really use it today."


Como se puede leer en el artículo, Google, ha seguido y planea continuar con la estrategia de apliar miles de máquinas baratas montando DataCenters descomunales (ha anunciado 4 de estos DataCenters de más de 600 millones de dólares en los últimos meses). Esta estrategia choca frontalmente con la de comprar pocas máquinas pero muy potentes (y caras) y desplegar virtualizar ahí todo tu software.

Pero claro, esta estrategia se sienta sobre la base de decenas de ingenieros trabajando full-time para optimizar todo el código de multi-threading, multi-core y clustering, en lugar de delegar esta tarea en algún proveedor de hierro, algo que no todas las compañías se pueden permitir.

Ahora bien... ¿sobrevirán al consumo de energía? Lectura muy interesante.