Mostrando entradas con la etiqueta amazon. Mostrar todas las entradas
Mostrando entradas con la etiqueta amazon. Mostrar todas las entradas

martes, febrero 15, 2011

Grupo sobre escalabilidad en español

martes, febrero 15, 2011 por Martín

Tal y como os comentaba ayer, los últimos días había estado comentando con Marc y Miguel Ángel Pastor la posibilidad de crear un grupo sobre escalabilidad, Hadoop, NoSQL, computación distribuida, etc.

La cosa ha surgido así como de casualidad. Miguel se pone en contacto conmigo preguntándome por listas o grupos sobre el tema; por otra parte, conozco a Marc que me cuenta que le gustaría potenciar la comunidad Hadoop en España, y ya lo demás es el poner en práctica mis habilidades de liante para que entre ellos dos monten un grupo en Google para ver si arranca esta comunidad :)

miércoles, enero 19, 2011

Elastic Beanstalk: Heroku para Java

miércoles, enero 19, 2011 por Martín

Heroku es un servicio online englobado en lo que se conoce como PaaS (Platform as a Service), y que básicamente permite el desplegar aplicaciones Ruby en una nube de servidores que se escala automáticamente para satisfacer las necesidades de carga de las aplicaciones.

En Java (hasta donde yo sé) no había demasiados servicios similares. Está Stax que lo compró Cloudbees me imagino que con la intención de hacer algo similar a Heroku, y estaba por supuesto Google App Engine que es una plataforma que prometía mucho, pero que entre las limitaciones que impone y los problemas que sufrieron muchos desarrolladores por tratarse de una Beta que era una "verdadera Beta", pues no ha tenido toda la popularidad que se podría desear.

viernes, diciembre 17, 2010

Lecciones sobre AWS aprendidas en Netflix

viernes, diciembre 17, 2010 por Martín

Tal y como escribía hace unos días, la arquitectura de Netflix está basada en Amazon Web Services. La compañía, decidió a principios de año migrar su arquitectura a Amazon.

En el blog de Netflix, comparten cinco lecciones que han extraído de su experiencia al mover su arquitectura desde su propio data center a la nube:

viernes, diciembre 11, 2009

Instantáneas del almacén de Amazon en UK

viernes, diciembre 11, 2009 por Martín

Un poco fuera de contexto pero no puedo evitar poner esta foto:



Se trata del almacén de Amazon en Milton Keynes, al sureste de Inglaterra. Impresionante. Le dedican un artículo en el Daily Mail.

Update: Creo que el de Swansea no se queda corto:



Más instantáneas aquí.

viernes, enero 09, 2009

Amazon lanza una consola de gestión para EC2

viernes, enero 09, 2009 por Martín


Bueno, pues si antes lo digo antes pasa lo contrario. Ayer sugería que había oportunidades para empresas en cuanto a gestión de los servicios de Amazon (exactamente lo que hace Rightscale). Pues ala, al día siguiente va Amazon y lanza en beta una consola de gestión para EC2. La he estado probando y tiene muy buena pinta, y además el UI es realmente rápido. Esta es una imagen del dashboard:



Se pueden elegir y lanzar instancias muy fácilmente:


O gestionar tus instancias (aunque en esta captura no tengo ninguna):

Ahora, la mala noticia es que ahora mismo es una beta US-only. O sea que si vas a la lista de las imágenes, pues no salen las que estén situadas en Europa. A ver si lanzan pronto la versión europea. Se comenta que pronto van a lanzar el equivalente para S3. Parece que la cosa mejora mucho en cuanto a gestión. Me imagino que si Amazon apuesta fuerte por este tipo de herramientas esto puede ser un golpe duro para algunas empresas que basen su negocio en ofrecer valor añadido alrededor de los servicios de Amazon.

jueves, enero 08, 2009

Datos históricos, trading y Cloud Computing.

jueves, enero 08, 2009 por Martín



Con el permiso de los que realmente saben de esto ahí va un post sobre Cloud Computing (o quizás debería decir Cloud Storage). Hoy he llegado hasta un artículo en WallStreet Technology que me ha parecido super interesante, al tiempo que me ha traido a la mente experiencias pasadas en mi primer trabajo aquí en Irlanda.

Uno de los retos más importantes que tiene cualquier aplicación de trading que se precie es la de permitir el análisis técnico de los instrumentos que presenta a sus usuarios. El inmenso volumen de datos que hay que manejar convierte el almacenamiento de estos datos en un factor muy importante a la hora de diseñar un sistema de este tipo. Y aunque existen algunas técnicas y bases de datos para disminuir el volumen de datos almacenados, según la exactitud de datos que necesites éstas no pueden ser aplicables.

Por poneros un ejemplo, en un sistema de divisas donde a lo mejor trabajas con 32 pares (eur-usd, usd-jpy, ...) puedes encontrarte con que las divisas más comunes cambian unas 16 veces por segundo, lo que nos da 960 valores por minuto, 57600 valores en una hora, y si asumimos una ventana de 8 horas para trading pues tenemos casi medio millón de valores. En fin, esto no es nada si lo comparamos con un mercado de valores como el NASDAQ o el FTSE donde hay muchos más valores.

Estos mercados además por sus características tienen unos requisitos regulatorios mucho más estrictos de los que pudiesemos haber tenido nosotros, ya que tienen la obligación de mantener durante largos períodos de tiempo el histórico de todos los valores del índice y de las operaciones que se han realizado, ya que estos datos pueden ser necesario para resolver reclamaciones, pleitos y todas estas cosas, así que por ley se ven obligados a mantener absolutamente todo.

El lugar más obvio para almacenar esta información es una base de datos, o un sistema de ficheros, que periódicamente se vuelca a DVDs o cintas de backup. Pero, y ya que dicen que está de moda, ¿por qué no almacenarlo en la nube? El artículo en cuestión con el que empezaba este post habla sobre como a Claude Courbois, associate VP, product development, de Nasdaq Data Products se le ocurrió el utilizar los servicios de Amazon S3 para uno de sus productos, Market Replay. El producto en si mismo ya es interesante, y básicamente consiste en ofrecerle una herramienta a los clientes de Nasdaq para que puedan reproducir una operación ejecutada en el pasado. Es como la máquina del tiempo del índice NASDAQ, y a los clientes les puede resultar enormemente útil si reciben cualquier tipo de reclamación ya que pueden demostrar que la operación ha sido legítima (o no).



Así, según parece Nasdaq está añadiendo diariamente entre 30 y 80Gb de datos a S3 en forma de 300.000 ficheros de datos, conteniendo cada fichero el equivalente a 10 minutos de actividad en el índice para un instrumento dado. La recuperación de datos desde S3 lleva menos de un segundo y con la ventaja adicional de que el sistema aprovecha "la nube" para escalar. Los clientes reciben la información instantáneamente sin tener que esperar a que se recupere de los sistemas de backup.

Otro factor muy importante que se menciona en el artículo y que parece que las empresas comienzan a entender es que durante el todo el desarrollo del producto no se ha pagado ni un céntimo extra por lo que no se utiliza. En un inicio Courbois comenta que recibieron facturas de tan sólo 5 dólares y no se vio obligado a gastarse 20000 dólares en hardware o realizar ningún megacontrato con alguna proovedora de servicios. Muy importante lo que comenta y que quizás en estos tiempos que corren sea más sencillo que a algunos les pueda entrar por la cabeza:

"Even though we're in a big company, every new project is a start-up, and you want to avoid situations where you have to plunk down a bunch of money to move forward."

El artículo también trata brevemente temas más polémicos como la seguridad y el soporte. Mi opinión personal es que ahí hay realmente mucho que hacer todavía, pero también hay mucho negocio, y compañías como RightScale no harán más que crecer y ganar mercado en los próximos años.

sábado, julio 19, 2008

Emprendedores, SeedCamp y la importancia de validar una idea

sábado, julio 19, 2008 por Martín

A través de Web 2.0 Ireland he llegado a un post realmente interesante de Saul Klein.

El artículo no deja de ser un post publicitario de SeedCamp, y de como este foro puede ser una buena herramienta para validar las ideas de potenciales emprendedores. Me quedo especialmente con una parte del mismo:

In today's environment, if you are in your 20s and you put [society's] [your parent's] economic fears aside, there has never been a better time to be a first-timer.


Y es que aunque los emprendedores ahora mismo se enfrentan al gran problema de que parece que todo esté ya inventado, de que hay una competencia enorme y de que las compañías poderosas se hacen cada vez más y más poderosas e intentan abarcar más y más, lo cierto es que nunca ha sido tan barato el montar un negocio y nunca ha habido tantos recursos disponibles ya sea en forma de librerías, frameworks y utilidades Open Source (como Java, LAMP o RoR), en forma de alojamiento de gran rendimiento y muy barato (como Amazon EC2/S3) o en forma de enormes plataformas gratuitas para ejecutar nuestros programas (como Google Apps Engine).

Una de las cosas que lamento más es el no haber intentado algo hace cinco años, cuando había tantas cosas todavía sin inventar. Ahora ya me ha pasado el arroz de los 20s, pero quien sabe si en los 30s habrá un poco más de suerte. En estos momentos en los que la recesión aprieta, y los jóvenes ya no están obligados a meterse en una hipoteca porque la vivienda siempre sube, quizás tenga más sentido que nunca el tomarse un descanso, olvidar el yugo del ladrillo y emprender.

Resulta también muy interesante que en la cena del The Accelerator Group que se comenta en el post 12 de las 15 startups que se reunieron estuvieran utilizando Amazon Web Services o probando Google App Services. Todo el mundo estaba usando LAMP, Python; Django o Ruby; y por supuesto todo el mundo estaba usando o pensaba usar f8 o OpenSocial; y parece que todos estaban pensando también en el nuevo iPhone.

En mi caso, os voy a contar un secretillo. Tengo algo. O bueno, más correctamente tenemos algo. No estamos en el grupo de RoR (aunque algunos se dediquen también a ello), si no en el de Groovy y Java. Sólo voy a dar una pista, la palabra clave es empleo. Y realmente espero que pronto (posíblemente Otoño) tengáis la oportunidad de validar nuestra idea :)

lunes, abril 14, 2008

Amazon reacciona. Habrá por fin almacenamiento persistente para EC2

lunes, abril 14, 2008 por Martín


Google lanza Google App Engine la pasada semana y todo el mundo se vuelve loco y ruegan que soporten sus lenguajes. Estaba claro que esto era un golpe importante para Amazon ya que parte de su base de usuarios irremediablemente se fugará a un servicio como el de Google, que es gratuito.

Amazon tenía que reaccionar. Y parece que lo ha hecho, aunque por ahora únicamente en forma de anuncio. Werner Vogels anunciaba ayer en su blog que Amazon ofrecerá en breve almacenamiento persistente como parte de sus servicios. La nueva funcionalidad permitirá crear volúmenes de almacenamiento persistente que variarán desde 1Gb hasta 1Tb de datos. Los volúmenes se podrán montar en cualquier instancia de EC2 y básicamente se comportarán como discos sin formato sobre los que se podrá instalar cualquier sistema de ficheros. Los volúmenes serán accesibles localmente dentro la zona de accesibilidad sobre la que hayan sido desplegados.

A mayores de esto, Amazon también ofrecerá la posibilidad de crear snapshots de modo que se pueda almacenar una imagen de cualquier sistema de ficheros en Amazon S3. La idea es que esto puede servir para replicar el sistema de ficheros en múltiples zonas de accesibilidad para construir aplicaciones geo-scalables. En el blog de Amazon Web Services ofrecen más información sobre el nuevo almacenamiento persistente para EC2.

Amazon anunció el pasado mes el lanzamiento de zonas de disponibilidad y IPs elásticas. Ahora reacciona con almacenamiento persistente para EC2. Y es que está claro que no hay nada como tener algo de competencia para dinamizar el mercado. Al final creo que los beneficiados somos nosotros, y la verdad es que ya dan ganas de que entren más compañías como Google en serio en el mercado del cloud computing.

sábado, marzo 29, 2008

Amazon mejora su oferta de cloud computing con IPs estáticas y múltiples datacenter

sábado, marzo 29, 2008 por Martín

Ayer estuve leyendo las novedades que ha añadido Amazon a su oferta de cloud computing y la verdad es que cada vez resulta realmente más atractiva.

Parece que lo primero que han hecho es añadir IPs estáticas; o bueno más correctamente lo que ellos denominan IPs elásticas, que sería como una IP estática pero asociada con una cuenta de usuario. De modo que un usuario no puede tener más de cinco IPs elásticas pero que las puede manejar a su antojo dándolas de alta, de baja, asociándolas a diferentes instancias en diferentes momentos, etc. En el blog de RightScale presentan un muy buen ejemplo de como utilizar estas nuevas IPs.

La segunda novedad es que ahora es posible disponer de servidores en múltiples localizaciones, gracias a lo que Amazon llama availability zones. Así pues, ahora amazon permite reservar instancias en diferentes regiones que pueden estar en diferentes países y continentes, y a su vez dentro de cada región se pueden seleccionar diferentes availability zones. Cada availability zone, garantiza su independencia de las otras zonas dentro de la misma región, de modo que si existe un desastre en una de las zonas, la otra todavía seguirá activa. Nuevamente en el blog de RightScale tienen un ejemplo fenomenal sobre como utilizar esta funcionalidad.

Se ve que Amazon se está espabilando a raíz de los últimos movimientos en el mercado. ¡Si es que no hay nada como la competencia!

jueves, marzo 20, 2008

IBM abrirá un centro de cloud computing en Dublin

jueves, marzo 20, 2008 por Martín

Noticia portada en los periódicos tanto online como impresos por estas zonas. Resulta que IBM abrirá el primer centro europeo de cloud computing en Dublin. Según se comenta en la noticia que enlazo, parece que IBM dará trabajo a 21 personas y basará su tecnología en software Open Source.

Hace poco ya comentaba que Sun se preparaba para competir con Amazon. Y la verdad es que parece que esto se está convirtiendo en una moda ya que hace unos días HP lanzaba su plataforma de cloud computing y parece que pronto lo hará Microsoft.

Está claro claro que los vendedores de servidores tienen que ponerse las pilas para entrar en un mercado ahora mismo dominado por Amazon y lleno de pequeños proveedores. A medida que pasan los meses cada vez son más empresas las que se apuntan a la moda del cloud computing y que ahorran costes, y dolores de cabeza, utilizando centros de computación virtuales, que además de ser bastante baratos son mucho más sencillos de administrar y, por qué no, proponen un modelo de computación mucho más limpio.

La verdad es que la cosa se pone la mar de interesante en este frente.

martes, febrero 19, 2008

Sun se prepara para competir con Amazon

martes, febrero 19, 2008 por Martín


Leo en DataCenterKnowledge que Sun Microsystems va a presentar en la JavaOne de este año su proyecto Caroline, lo que parece ser una nueva línea de negocio orientada al cloud computing. El artículo de DCN enlaza a otro artículo en The Register con mucha más información.

Para propocionar la infraestructura que competirá con Amazon utilizarán la virtualización disponible por defecto en Solaris 10, junto con Solaris ZFS, lo que debería garantizar un rendimiento superior a los sistemas ofrecidos por Amazon, basados en Xen.

El hosting se haría en Sun pero también se insinua que los usuarios podrán alojar sus propios grids. El almacenamiento parece que podrá realizarse vía MySQL (especulo aquí que probablemente después de la compra este sería el sistema que soportarían comercialmente) , PostgreSQL o Apache Derby. La autenticación parece que sería vía liberty.

En este enlace hay una presentación de la JavaOne 2007 con más detalles sobre el proyecto Caroline.

Wow, esto realmente promete mucho. La verdad es que no deja de ser realmente paradójico que tenga que ser una compañía que empezó vendiendo libros la que esté guiando el camino de otras compañías que llevan sufriendo muchos años para tener beneficios económicos. ¿Habrá encontrado Sun por fin otro filón?

viernes, febrero 01, 2008

¿Es EC2 la solución para los tests de carga?

viernes, febrero 01, 2008 por Martín

Observando las noticias que se van sucediendo relacionadas con el mundo de los servidores, parece que una tendencia últimamente es el utilizar instancias grandes de Amazon EC2 para realizar los tests de stress.

Y es que la idea es realmente atractiva. ¿Para qué molestarse en comprar o alquilar servidores y generar miles de clientes simulados en los mismos si por un módico precio puedes aprovechar la estructura de Amazon para ello? Es más, si el proceso de test de stress se realiza, digamos una vez al mes, pues una razón más para llevarse ese servicio a EC2 ya que la facturación es por hora de uso.

Aunque esto parecería algo dirigido especialmente a startups, parece que en Oracle es lo que están haciendo para probar Coherence y también en Webtide para probar su servidor de aplicaciones Jetty.

Está claro que el concepto de cloud computing está cambiando poco a poco la forma de trabajar de las empresas. ¿Cuánto tardarán los grandes vendedores de hierro en ofrecer servicios similares? Porque Microsoft y Google tienen este sector en el punto de mira, y tarde o temprano la popularidad de estos servicios tiene que ir haciendo mella en la facturación de las compañías que nos venden servidores físicos. Seguramente tendremos que esperar un par de años para verlo.

(foto de midom@flickr)

domingo, enero 06, 2008

Granjas, fábricas y nubes, el futuro de la computación

domingo, enero 06, 2008 por Martín

Según Julio Guijarro y Steve Loughan ambos miembros del grupo de investigación que tiene HP en Bristol ese es el futuro de la computación distribuida. Julio y Steve han publicado el pasado Diciembre una presentación muy interesante en la que hablan de como los modelos de servidor único y de un cluster de servidores han quedado obsoletos en favor de un modelo de granja con cientos de servidores donde el sistema de ficheros es distribuido y el almacenamiento y la CPU se alquila. Se trata de una infraestructura ágil, como ellos la denominan, y que tenderá en el futuro a una gran fábrica de grids con decenas de miles de servidores



Esta evolución se sustenta en la base de que las arquitecturas actuales han anulado ciertas asunciones que en el pasado eran verdaderas pero que Julio y Steve afirman que ya no lo son. Pongo la lista a continuación ya que aunque es posible que no se esté de acuerdo de todo me parece un buen resumen sobre las consecuencias arquitectónicas que tienen algunas tendencias actuales.

Arquitectura: Virtualización. Asunciones que ya no son ciertas:

  • Los sistemas permanecen activos por enormes espacios de tiempo.

  • Crear un nuevo sistema es caro y lento.

  • Duplicar un sistema existente es algo muy caro.

  • Los sistemas deben controlarse manualmente.

  • Los relojes están sincronizados.

  • La RAM nunca se "swappea".

  • Las máquinas que están en ejecución no pueden ser movidas y/o clonadas.


Arquitectura: Granjas de servidores. Asunciones que ya no son ciertas:

  • El fallo en un sistema es un evento inusual.

  • El 100% de disponibilidad se puede conseguir.

  • Los datos siempre están cerca del servidor.

  • Se necesita acceso físico al servidor.

  • Las bases de datos son la mejor forma de almacenamiento.

  • Necesitas tener millones de euros para ser un competidor en tu rama.


Arquitectura: Map/Reduce. Asunciones que ya no son ciertas:

  • Es difícil trabajar con terabytes de datos.

  • El código se ejecuta siempre en una única máquina.

  • El código ejecutado secuencialmente es mejor que el código ejecutado en paralelo.

  • La mejor forma para almacenar los datos es con sistemas RAID.

  • Las bases de datos son mejores que los sistemas de ficheros.


Arquitectura: Sharding. Asunciones que ya no son ciertas:

  • Una única granja puede escalar hasta el infinito.

  • Necesitas proporcionar 100% de disponibilidad al 100% de tus usuarios.

  • Cambios en la aplicación cambian la totalidad del esquema de base de datos.


El análisis realizado me ha parecido muy interesante. El argumento central de la presentación es que la computación poco a poco se está conviertiendo en una commodity, como las granjas que nos preparan la comida o las fábricas que nos hacen la ropa.

Sistemas sobre los que he estado hablando continuamente en los últimos meses, como S3, EC2, la nueva SimpleDB o Hadoop han cambiado la forma de entender la computación distribuida y, concretando en el caso de Amazon, proponen un modelo de renting muy atractivo que permite a pequeñas startups ponerse a la altura de grandes corporaciones.

Por cierto, que no lo había comentado, Julio Guijarro es el líder del proyecto SmartFrog, que personalmente no conocía y que tiene como objetivo el proporcionar una tecnología que describa sistemas de software distribuidos como colecciones de componentes manejables y activables. Por la descripción se me antoja como algo similar a Dryad de Microsoft. Eso sí, éste está liberado bajo licencia LGPL.

domingo, diciembre 16, 2007

Lo nuevo de Amazon: SimpleDB

domingo, diciembre 16, 2007 por Martín

Parece que Amazon acaba de lanzar una limited beta de su nuevo servicio web SimpleDB. A estas alturas (el lanzamiento fue el Viernes) ya hay un montón de información sobre sus características técnicas. Una de las más llamativas es que el servicio web se ejecuta sobre erlang.

El nuevo servicio web propone un modelo muy simple basado en tener un dominio de datos que almacenará items los cuáles tendrán diferentes atributos en forma de clave valor. Sobre ese dominio se pueden ejecutar diferentes operaciones:
  • CREATE: para cear una nueva base de datos.
  • GET, PUT, DELETE: para obtener, crear o actualizar y eliminar items y propiedades en una base de datos.
  • QUERY: para hacer consulta de datos. Las consultas están limitadas a cinco segundos.

El precio depende de diferentes factores como la cantidad de CPU utilizada al realizar las operaciones, el ancho de banda consumido tanto in como out, y el espacio en disco ocupado por la base de datos. Pero vamos anda en torno al 0.14$ por hora, 0.11$/0.18$ al mes por Gb. in/out y 1.50$ al mes por Gb. de almacenamiento.

Sobre todo esto y más detalles podéis consultar la web de SimpleDB desde la que tienen también una guía para iniciarse y y la guía de desarrolladores. De todas las opiniones que hay ya ahora mismo en la blogosfera sobre el servicio, me he quedado con las que me resultan particularmente interesantes y que resumo a continuación.

Charles H. Ying apunta varias consideraciones importantes en su blog como que la latencia en la sincronización de datos entre diferentes nodos puede ser grande (+1 sec.), que las queries sobre los objetos son lexicográficas (ej. 4 > 35 pero 04 < 35), o que el API no soporta búsquedas de texto. En High-Scalability no han tardado en hacerse eco de la noticia y ya publican una amplia lista de pros y contras. Parece que la mayor parte de los contras se centran en que el servicio es caro para lo que ofrece, en los posibles problemas de consistencia y latencia, la falta de soporte para algunos lenguajes, y resumiendo en que no te ofrece mucho lo que una base de datos te puede ofrecer ahora mismo; los pros se centran sobre todo en el aspecto "hosted", es decir en que no se necesita un administrador de base de datos, en que no necesitas comprar la base de datos ni hardware, en su soporte de replicación y en que puede ser algo muy interesante para startups.

Sriran Krishnan hace una revisión técnica bastante completa donde muestra un ejemplo de petición/respuesta utilizando el API REST que ofrece SimpleDB y se centra también en el problema de la latencia de las actualizaciones y que los datos no se repliquen instantáneamente en todos los nodos. Este punto es interesante, pero en mi opinión no refleja otra cosa sino que este servicio está enfocado hacia cierto tipo de aplicaciones y no debe utilizarse como una silver bullet. Por poner un ejemplo, realmente en un portal de opiniones sobre viajes, restaurantes, hoteles, lo que quieras, la consistencia de los datos en un márgen de unos segundos no es precisamente algo muy importante.

Don MacAskill apunta también algo bastante importante y es que este servicio puede que sea apto sólo para aquellos que ya estén utilizando Amazon EC2. La razón fundamental es la latencia. A no ser que nuestros servidores estén cerca de los de Amazon, sí decidimos utilizar SimpleDB tendremos que sumar a cada consulta el tiempo de latencia en obtener dichos datos, lo que dependiendo del número de consultas puede ser un problema importante.

miércoles, noviembre 07, 2007

Amazon S3 en Europa, 10 millones de objetos y algunas notas

miércoles, noviembre 07, 2007 por Martín

Leyendo el blog de Diego Parrilla me entero de que Werner Vogels, CTO de amazon, ha anunciado que ya es posible contratar los servicios de S3 usando servidores que estén en Europa. Buenas noticias para todos los negocios que estaban ya utilizando S3 y que tendrán un buen empujón a sus estadísticas de rendimiento y latencia (suponiendo que se pueda migrar fácilmente de USA a Europa si ya eres cliente, algo que es de esperar), y también para todo el que planease utilizar los servicios de S3 para aplicaciones orientadas al mercado europeo.

No hay duda que los servicios de Amazon están siendo un éxito. Ayer leía que ya hay más de 10 billones de objetos almacenados en su servicio S3, cifra realmente impresionante y que ya citó Mike Culver en la charla que dio en Dublin hace una semana.

John O'Shea tiene un muy buen conjunto de notas sobre esta charla y en las que se pueden leer algunas curiosidades como que las imágenes de sus servicios están basadas en Fedora 4, que el servicio de Flexible Payment Service sólo disponible en USA lo estará también en Europa en un futuro y que Amazon S3 no coloca automáticamente las cabeceras de caché (ETag, Last-Modified), algo un poco "dodgy" como dirían por aquí.

miércoles, octubre 17, 2007

Nuevos tipos de instancia en Amazon EC2

miércoles, octubre 17, 2007 por Martín

Los chicos de Amazon han decidido que ya es suficiente de tener un único tipo de instancias en Amazon EC2 y ahora proporcionan también instancias en los tamaños large y extra-large. Los detalles de los diferentes tipos de instancias se pueden ver aquí.

Esto vendría a ser un movimiento en respuesta a la buena acogida que están teniendo los servicios web de Amazon ya que cada vez aparecen más y más sitios web que los utilizan y a los que seguramente se les quedaban escasos las 20 instancias que Amazon permitía hasta el momento.

Si os interesa más sobre el tema podéis echar un vistazo a la guía de funcionalidades.

lunes, octubre 15, 2007

Amazon Web Services Startup Challenge

lunes, octubre 15, 2007 por Martín

¡Atención Startups y emprendedores!

Así, comienza el anuncio del Amazon Web Services Startup Challenge en el que Amazon premiará a la idea o aplicación más original y que haga mejor uso de sus servicios web con hasta 100.000$ en metálico, que no está nada mal.

Todos los interesados pueden presentar sus ideas/aplicaciones rellenando el formulario online, y asegurándose claro de que cumplen las reglas.

La fecha límite es el 28 de Octubre.

miércoles, agosto 08, 2007

Dentro de los datacenters de eBay y Amazon

miércoles, agosto 08, 2007 por Martín

En CRN han publicado un resumen de las keynotes de eBay y Amazon en la Next Generation DataCenter Conference.

Las conclusiones son más o menos las de siempre, ambas compañias apuestan por la virtualización, amazon hace publicidad de sus servicios (además presentó en sociedad su nuevo payment service), eBay recalca la importancia que tiene para ellos sus datacenters con los billones de SQLs por día que ejecutan, etc.

Siempre es interesante leer sobre estos gigantes así que aquí queda por si a alguien le interesa.

martes, agosto 07, 2007

Hadoop toma protagonismo

martes, agosto 07, 2007 por Martín

Parece que uno de los proyectos que han tenido bastante éxito en la OSCON 2007 ha sido Hadoop, un subproyecto de Apache Lucene que implementa el conocido algoritmo de MapReduce utilizando su propio sistema de ficheros distribuido.

Tim O'Reilly ha publicado un extenso artículo sobre esta librería y la importancia de que Yahoo esté detrás de ella. En particular destaca la importancia de que Yahoo escoja el camino de contribuir al Open Source y respaldar proyectos exitosos como Lucene como base para las herramientas que utiliza, en lugar de seguir el camino de hacer desarrollos internos, que es el aparente camino que sigue Google (no quita que haya liberado interesantes frameworks).

Aún así el creador de Lucene y Hadoop, y ahora empleado de Yahoo, Doug Cutting, destaca que Hadoop no está limitado a la búsqueda ni tiene porque ser ese el escenario en el que rinde mejor:


"Where Hadoop really shines, is in data exploration." Many problems, including tuning ad systems, personalization, learning what users need -- and for that matter, corporate or government data mining -- involve finding signal in a lot of noise.


Y el artículo termina con un ejemplo de como utilizar MapReduce para afrontar la explotación de ficheros de log gigantescos.

El caso es que en la Yahoo Developer Network han publicado las charlas, powerpoints, video y audio de la presentación realizada en la OSCON y una entrada antes también hablan sobre la evolución del proyecto.

High Availability ofrecía un análisis hace poco sobre este producto. Y bueno, en casi todas estas fuentes referencian al artículo de Julio sobre como integrar Hadoop con Amazon Web Services.

Desde luego, parece que suena bastante. Por cierto, ¿a alguien le interesa jugar con Hadoop y Amazon? Un proyecto realmente interesante sería integrarlo con Apache Jackrabbit de forma que pudieses almacenar contenido de cualquier repositorio en un sistema de ficheros distribuido, como por ejemplo el de Hadoop, y que a su vez se volcase en un servicio como Amazon S3. Y además sería una contribución espectacular para jLibrary :D

miércoles, mayo 16, 2007

Otras dos sobre escalabilidad: S3 y Ruby on Rails.

miércoles, mayo 16, 2007 por Martín

Dos más para tener en cuenta:
Set Amazon servers on fire, not yours.
Scaling scribd