Affichage des articles dont le libellé est Etalab. Afficher tous les articles
Affichage des articles dont le libellé est Etalab. Afficher tous les articles

jeudi 3 avril 2014

Raphaël Guilleminot, design manager au sein d’Enigma.io, startup de NYC de l’open data

Le parcours aux US de Raphaël Guilleminot, design manager au sein d’Enigma.io, startup new-yorkaise opérant dans l’open data 


Il évoque pour nous sa perception très particulière de l’open data, la genèse d’Enigma, leurs travaux dans l’open data, la création de valeur dans la donnée publique, son parcours de designer, la Silicon Alley et l’importance toute particulière de la composante design produit aux US.

Interview 360° !

Echange avec Matthias FILLE, conseiller IT / TMT à la CCI de Paris


Raphaël, je te laisse te présenter en quelques mots
Je suis né en France mais y ai très peu vécu. J’ai effectué mon parcours dans le design industriel et interactif successivement au Canada, au Japon en Suède. Donc à vrai dire, je n’ai jamais travaillé en France. Puis, j’ai rencontré l’un des « futurs » co-fondateurs[1] d’Enimga.io au lycée en France. Quant à l’autre co-fondateur, Marc Da Costa, j’ai fait sa connaissance à Columbia.
A l’époque où je les ai rencontrés, ils avaient commencé le concept et le prototypage d’Enigma.io. De surcroît, ils étaient intéressés à intégrer une expertise et une composante de design. C’est là que j’ai intégré l’équipe d’Enigma.io en phase très embryonnaire du projet.

Comment a émergé le concept d’Enigma ?
L’idée d’Enigma leur est venue en parcourant l’article d’une personne qui avait découvert avant tous les analystes politiques, qu’à la surprise générale, Sarah Palin serait nommée en colistière de John Mc Cain à l’élection présidentielle de 2008. Pour cela, il avait consolidé et croisé des data sets publics (donc à la portée de tous) d’enregistrement de possession d’avions, de donateurs républicains. Il avait par la suite établi des corrélations d’appartenance ou d’influence entre eux. Cette personne s’est ainsi rendu compte avant tout le monde que ces derniers affluaient simultanément vers Wasilla, en Alaska, (fief de Sarah Palin). Ainsi, cet exemple symptomatique souligne l’ambition et la proposition de valeur d’Enigma à vouloir démystifier l’open data (qui est à ce jour trop énigmatique et « indigeste »), en créant de l’usage, de la valeur et de la contextualisation à partir de ces données publiques.

Comment se présente la solution ?
Nous proposons une plate-forme de recherche, de découverte et d’approvisionnement de données publiques fournies par le gouvernement, des entreprises privées et autres organisations que nous jugeons pertinentes. Notre outil permet de trouver des faits et des liens cachés à travers des sources de données disparates et cloisonnées. L’intelligence de notre plate-forme est de vous fournir la data et de l’intelligence à laquelle vous n’étiez pas « prédisposé ».
Par exemple, sur un sujet qui vous intéresse, nous ne nous cantonnons pas à vous fournir les data directement liés au sujet. Nous vous approvisionnons également avec les datas qui ont un impact sur votre sujet d’étude mais auquel vous n’aviez pensé ou pas découvert la corrélation et l’impact d’influence. Nous sommes ainsi très positionnés sur les données qualitatives et la contextualisation. Notre solution est en mesure de s’appuyer par exemple sur des réseaux d’entité, des réseaux de filiales, de connexions contractuelles ou d’influence entre opérateurs. La contextualisation est la philosophie de l’open data chez Enigma.

A quel problème de l’open data Enigma cherche-t-il à répondre ?
Le problème inhérent aux données publiques est qu’elles sont publiées par le gouvernement américain, des services décentralisés ou des agences marketing de manière indépendante et atomisée. Du coup, il est complexe de centraliser ces données et de déterminer son usage et son intérêt. Par ailleurs, les données publiques navigant sur Internet ne sont pas facilement identifiables et unifiées en tant que telles puisque disséminées. En soi, les données publiques n’ont pas beaucoup de valeur. C’est justement là que nous intervenons en tant que levier de création de valeur à partir de ces données.

Comment allez-vous crawler ces données ?
Nous collectons les données de différente manière. La première est d’implémenter des crawlers[2] adossés à des domaines et portails gouvernementaux d’open data dédiés pour aller chercher et indexer les données mises à disposition. Deuxièmes, lorsqu’il s’agit de cibles et d’agences très particulières, qui nous intéressent, sur des thématiques affinées, nous allons chercher nous-mêmes la donnée. Et avec le volet coercitif pour les agences de se conformer au Freedom of Information Act[3], nous avons la possibilité d’effectuer des requêtes auprès d’agences gouvernementales pour obtenir de nouvelles sources de données. Elles ont ainsi le devoir de libérer la donnée. Elles n’ont en revanche pas d’exigence de délai et peuvent demander des coûts de publication auprès des demandeurs. Elles peuvent ainsi nous publier sous n’importe quel format ! Donc, on se heurte aussi à une bureaucratie assez lourde sur ce deuxième mode opératoire. Troisièmement, notre méta moteur se charge de regrouper des données disséminées sur internet difficilement identifiables et consolidables.

A quelle clientèle Enigma s’adresse-t-il ? Quels industries et verticaux en particulier ?
Nous collaborons avec de grosses entités de consulting, de crédit, d’assurance, de banques et  hedge funds. Ils cherchent à étoffer leurs analyses, élaborer de nouveaux indicateurs connexes, améliorer leurs leviers décisionnels, faire de nouvelles projections avec des modèles plus élaborés via de nouveaux jeux de données. Par exemple, des banques auront recours à nos services pour améliorer leurs algorithmes qui déterminent la solvabilité de leurs clients. Cette partie « gros clients » nous demandent particulièrement d’efforts étant donné que nous sommes partie prenante dans la recherche des datas. Par ailleurs, nous avons une autre catégorie de clientèle professionnelle qui, elle, souscrit à un abonnement pour avoir accès à notre plate-forme d’outil de recherche de la donnée et de représentation.
De surcroît, notre API[4] fournit une infrastructure dédiée et accessible aux développeurs et professionnels. Ils peuvent ainsi intégrer nos corpus de data en temps réel à grande échelle afin d’étoffer leurs applications tierces, services analytiques et tableaux de bord.

Je me souviens que le Président Obama « himself » (et oui !) avait retweeté vos travaux d’open data sur le shutdown[5] en Octobre 2013 (pour mettre la pression sur le vote du budget et montrer l’ampleur de l’inertie). Sur quels autres types de projets travaillez-vous actuellement ?
Ouais, on était assez fiers de cela !
Nous avons récemment travaillé sur un projet d’import-export avec les douanes américaines qui recensent l’ensemble des containers et leurs contenus partant et arrivant aux Etats-Unis. Chaque semaine, ils nous envoient un CD de jeux de données (on a d’ailleurs dû se racheter un lecteur CD pour l’occasion !). On peut par exemple déterminer le nombre de nouvelles Lamborghini sur le sol américain. Et à partir de là extrapoler très simplement sur l’évolution de la consommation intérieure ou l’évolution du nombre de millionnaires aux Etats-Unis par exemple, avec toujours en sus notre savoir-faire d’enrichissement et contextualisation.

Vous venez de lever à nouveau des fonds. Quels changements et orientations structurels cela va-t-il apporter ?
Nous avons en effet levé fin Janvier 2014 (en série A) 4,5 M$ auprès de Comcast Ventures avec des participations d’American Express Ventures, Crosslink Capital et New York Times Company. Toutes ces participations reflètent la transversalité des applications d’Enigma (transparence, journalisme, banque, …). Pour rappel, nous avions également levé 1,1 M$ auparavant en seed funding début 2013. Par ailleurs, nous allons prochainement annoncer que l’accès à notre plate-forme et recherche de données sera gratuit ! C’est quelque chose que nous avions en tête dès le départ dans notre milestone.
Mais l’intégrer dès le départ aurait été trop couteux. Cela marque un tournant majeur dans notre stratégie et la montée en puissance de notre projet. L’idée derrière cela est de démocratiser notre plate-forme, de démontrer notre scalabilité et proposer davantage de services premium et d’outils analytiques. Ainsi, la combinatoire de ces deux éléments va nous permettre d’adresser de gros clients et poursuivre nos travaux sur les réseaux d’entités en web sémantique. Car je le répète, c’est notre philosophie de l’open data !

Comment compares-tu l’écosystème de l’open data entre la France et les Etats-Unis ?
Tout d’abord, je salue le travail qu’entreprend Henri Verdier[6] à Etalab. C'est un mec extra.
Je trouve que son agence fait un travail remarquable pour libérer et inciter les pouvoirs publics et les ministères à libérer la donnée. Il a donné à Etalab un vrai second souffle. Car pour opérer dans l’open data, il est inconcevable et impossible pour une entreprise privée d’inciter les pouvoirs publics à libérer la donnée sans le travail d’évangélisation et de sensibilisation d’une agence comme d’Etalab. Pour faire émerger un écosystème vertueux de l’open data, il faut que la dynamique soit insufflée au niveau des pouvoirs publics, ce que fait remarquablement bien Etalab. Aux Etats-Unis, le mouvement s’est accéléré sous la bannière du Freedom of Information Act et de l’Open Government Initative[7] de l’Administration Obama. Le Freedom of Information Act relève d’un volet législatif qui stimule certes l’open data, mais qui dépasse plus largement ce périmètre. Cela découle de la culture historique de la transparence aux Etats-Unis, et cela même auprès d’opérateurs privés. Aux Etats-Unis, la libéralisation des données publiques est un axe central. Cette conjonction permet de faire émerger un écosystème et une économie autour des applications et des usages. Aussi, la France est très stricte sur l’anonymisation et la mention de noms privés adossés aux jeux de données. A contrario, je pourrais vous dire très facilement, via le Gouvernement de New York, de combien de propriétés immobilières Robert de Niro dispose à New York.

En tant que designer d’Enigma, quel regard croisé transatlantique portes-tu sur le design interactif quand on connait la primauté du marketing et du design aux Etats-Unis dans la composante produit ?
Les français sont bons en design. Et plus particulièrement en graphisme ce qui n’est pas tout à fait la même chose. Ainsi, je pense que trop de talents français se prédestinent vers le design industriel ou le graphisme, par exemple dans le domaine publicitaire et industriel. Il manque à la France une culture plus prononcée de l’interaction design[8], qui est une discipline très imprégnée et très enseignée aux Etats-Unis. En effet, j’estime que le plus gros obstacle à la compréhension et à la démocratisation des données, par le public, est lié à la difficulté à faire ressortir des cas d’usages et d’applications.
Ainsi, le design interactif a émergé car nous étions jusqu’ici limités par les possibilités techniques très réduites de l’infographie et de la visualisation classique. Par exemple, on ne pouvait mettre en relief qu’un seul sujet d’étude. Or, le design interactif permet justement de rendre les outils de recherche accessibles et d’offrir un cadre de contextualisation.

De France, nous avons l’impression que la Silicon Alley[9] prend sa revanche sur la Californie en ce qui concerne l’entrepreneuriat numérique. Ton sentiment ?
En effet, New York explose actuellement au regard du nombre de startup. La Silicon Alley est un écosystème très vivifiant. Par rapport à la Californie, j’estime que les business model des start up de New York sont dans une certaine mesure, peut-être moins nombreux, mais plus « sérieux » et réalisables. Par ailleurs, les startup de New York sont positionnées, pour la très grande majorité, sur le créneau du B2B a contrario de la Silicon Valley. Elles sont également très portées sur le design interactif. On peut expliquer cet aspect par l’historique de l’industrie de la publication et des médias de New York. De surcroît, les Venture Capital locaux sont « moins » spéculatifs et préfèrent se positionner sur des business model plus « sérieux » par comparaison avec la Silicon Valley

Pour conclure, peux-tu me souligner quelques startup que tu apprécies?
Niveau français, j’appréciais beaucoup Everpix[10] (soutenu par Index Ventures) que je considérais comme le meilleur service de stockage de photos dans le cloud via n’importe quel terminal. Mais, ils ont malheureusement du stopper leur activité fin 2013 faute de financements suffisants. Everpix n’a pas eu le temps d’atteindre sa masse critique monétisable. Côté américains, je suis admiratif de Zendesk[11] (qui n’est plus une startup et fondé par des danois je crois !) au regard de l’excellence du niveau produit qu’ils ont atteint. Même chose pour GitHub[12], qui a réussi à rendre accessible à tout à chacun la publication de codes et la construction d’applications (par essence très compliqué).

Merci à toi Raphaël, à 1 de ces 4 sur NYC !

Pour en savoir plus :




[1] Hicham Oudghiri
[2] Robots d’indexation conçus pour collecter des ressources
[3] Le Freedom of Information Act est une loi américaine de 1966. Fondée sur le principe de la liberté d'information, elle oblige les agences fédérales à transmettre leurs documents, à quiconque en fait la demande
[4] Une Interface de programmation (API) est un protocole de communication temps réel par lequel un logiciel offre des services à d’autres logiciels comme la mise à disposition et l’actualisation de données en temps réel
[5] Mésentente parlementaire sur le budget 2014 qui a entraîné durant quelques semaines l’arrêt du financement des agences gouvernementales
[6] Henri Verdier, co-fondateur de MFG Labs (racheté depuis Havas) et ancien Président du pôle de Compétitivité Digital est depuis Janvier 2013, Directeur d’Etalab (service du Premier ministre français, chargé de créer un « portail unique interministériel des données publiques » françaises)
[7] Cette « initiative » vise à créer un niveau sans précédent de transparence et d'ouverture du gouvernement dans la tendance de l'open source governance et de l’open data, pour permettre à tout citoyen et entreprise intéressés de contribuer à créer les contenus de la politique
[8] Design numérique des systèmes interactifs
[9] La Silicon Alley est un pendant de la Silicon Valley, située en plein cœur de Manhattan. Elle est une technopole concentrant des startup spécialisées dans Internet, les médias, l'édition, la publicité
[10] Everpix a été créé en août 2011 par deux français, Pierre-Olivier Latour, ancien de chez Apple et fondateur de Quartz Composer, et Kevin Quennesson
[11] Zendesk propose aux entreprises les outils nécessaires leur permettant d'établir un service de support auprès de leurs utilisateurs
[12] GitHub est un service web d'hébergement et de gestion de développement de logiciels, utilisant le programme Git

lundi 28 janvier 2013

Big Data (2/3) Ok, mais quel champ applicatif à la Big Data Analytics ?

Avec les techniques permises par le big data : puissance analytique, croisement de données hétérogènes non structurées, analyse avec une granularité la plus finie permise, mise en relief de corrélations cachées, nous assisterons à l’évolution de la manière de prodiguer des protocoles de soins. 

Nous n’étudierons plus, selon la même grille de lecture, l’étude du parcours de santé de chacun et le choix thérapeutique approprié. Ainsi, à terme, il sera dénué de sens que deux personnes souffrant d’une même pathologie reçoivent, selon un protocole de soin standard, un traitement identique et générique.  

Comme le précise Gilles Babinet : « de nombreuses avancées médicales aboutissent au même constat : les protocoles de soins sont vétustes, reposent trop sur la chimie et ne tiennent pas compte d'un environnement multifactoriel. La connaissance précise des antécédents médicaux de l'un et l'autre des patients, la connaissance des environnements dans lesquels ils évoluent et, dans un temps plus lointain, le séquençage massif des ADN vont permettre de faire des avancées en matière de qualité de soins ». Cela sera permis grâce à l’exploitation, l’analyse et la synchronisation de données cliniques et exogènes, jusqu’ici non exploitées. Le dossier médical personnalisé devra épouser, sans écart de virage, cette dynamique. 

Pas de prêche virulent, il ne s’agit pas d’être poujadiste et révisionniste sur les sciences fondamentales. Ne versons pas non plus dans l’obscurantisme et le déni. De nombreux métiers seront impactés voire refondus par la mise en relief de corrélations ou de phénomènes impalpables, qu’on pensait à ce jour comme non-impactants. Loin de là mon aspiration d’être reçu en consultation par un data scientist. Cependant, il est inéluctable que les fonctions médicales devront s’appuyer sur les possibilités d’aide à la décision offertes par la Big Data. Non pas in fine pour se limiter à un meilleur traitement curatif et optimiser l’existant. Mais bien pour explorer de nouveaux horizons préventifs : anticiper de manière prédictive de prochaines pathologies pouvant subvenir. 

 Tout cela dans un souci de faire monter en gamme les outils d’aide à la décision existants, somme toute très archaïques. Reste dès lors à baliser l’accompagnement à l’intégration de ces outils analytiques technologies dans une perspective d’aide au diagnostic curatif et préventif. Au risque d’être ostracisé, cela se confrontera, sans nul doute aux admonestations (mot compte double) de la profession médicale. On peut la supposer à l’instar des profs assez peu gourmande du reingenering de leur métier. Mais nous sommes face sans nul doute au nouveau levier de modernisation et du monde de la santé et dépenses associées.


Autre illustration, proof of concept plus contemporaine : la politique, in situ, in vivo. Moins de tracts, moins de phoning. C’est l’envers du décor. Normal il a plus essayé de refourguer à ses concitoyens ses perspectives plutôt que « Yes, I can Big Data ». On ne lui en tiendra pas rigueur. Ça aurait tâche, au regard de sa fonction, d’être élu sur sa maîtrise du traitement de données et des pratiques du Big Data. 

Anticipant le climat de morosité, d’indifférence et d’indécision de nombreux citoyens, Obama anticipait un électorat de sympathisants démocrates moins mobilisé. Il a ainsi constitué une conséquente équipe de data scientists. Cinq fois plus conséquente qu’en 2008. Un bataillon d’une centaine de data scientists au bas mot. Malgré l’émotion qu’il suscite auprès de certains quand il embrasse langoureusement Michelle, ces p’tits soldats ont clairement été une pierre décisive au sésame « four more years ». 

 
Leur fait d’armes ? Avoir constitué une giga base de données alimentée en continu, analysée et discriminée sur des attributs sociologiques, géographiques, ethniques, cercles d’influence propres à chacun, d’aversion aux démocrates, ou autres données hétérogènes non structurées. Les traitements massifs et combinaisons opérés ont permis de tester et modéliser les effets d’entraînement et cela à une échelle infinie. 

Illustration. Quel argument électoral ferait pencher une femme d’origine afro-américaine vivant dans le Missouri présentant un profil de sympathisante en 2008 et donc de donatrice potentielle. Ne restait plus qu’aux équipes d’orchestrer un programme marketing ciblé et destiné à notre bienheureuse et ses semblables pour la convertir en donatrice. Les discours larmoyants de Scarlett Johansson et autres Sean Penn se chargeaient d’apporter la touche émotionnelle de vernis glamour pour achever de les convaincre. 

Cette stratégie d’analyse de données a permis une analyse individuelle avec une granularité infime. En back up, les technologies analytiques de temps réel ont permises lors du D-Day une anticipation de l’allocation pertinente des équipes terrain sur les bureaux de vote anormalement peu mobilisés. On peut supputer que les analyses prédictives d’affluence, pouvaient être par exemple croisées dynamiquement avec des attributs de météo peu clémente (météo sensibilité) et donc « citoyennement parlant », peu incitative. 


Quand en parallèle, la stratégie Romney s’articulait désespérément sur les statiques sondages d’opinions. Amer, cinglant pour les républicains. 

Que penser de cette victoire triomphante de l’analytique. Mouvement majeur de prise compte de l’individu ? Recentrage de l’intérêt citoyen à une échelle individuelle et locale ? Nouveau modèle d’exploitation et d’expérimentation politique éprouvés et légitimités ? Manipulation de passe ou Président trendy porté sur l’hightech ? Ou plus simplement souveraineté de l’exploitation analytique. 


Trop mercantiliste à votre goût ? 

Arrêtons de conceptualiser la big data sous la seule ornière commerciale. 

Exemple philanthrope et empirique à l’appui. L’ONU écrit un nouveau chapitre dans l’analyse prédictive afin de sortir du carcan statique dans cet environnement non linéaire. Grâce à la data, l’ONU ne veut plus devenir spectateur passif d’une épidémie. Ne veut plus être tributaire de nébuleuses analyses.   

Désormais, nous n’aurons plus besoin de BHL ou de George Clooney pour nous alerter en amont sur l’imminence d’un drame humanitaire. Analyse à un niveau local de tendances, nature des interactions sur un réseau social, pic d’achat soudain de denrées alimentaires, début de flux migratoires, bouleversement politique local : le Projet Global Pulse de l’ONU a l’ambition d’analyser cela en temps réel dans une logique analytique prédictive. Comme le précise Henri Verdier (ancien président de Cap Digital, tout fraîchement nommé à la mission Etalab et PDG de MFG Labs), « la plupart des actions de l'ONU (politique économique, la gestion des crises, les opérations de maintien de la paix) ont besoin de données fiables, actionnables, et obtenues dans un délai très court. Puisque désormais l'empreinte de presque toutes les activités humaines et l’implication sociétale sont imprimées et géo-localisables dans les réseaux numériques, il devient donc très tentant d'aller chercher, dans ces données ouvertes et anonymisées, les éléments de décision dont l'organisation a besoin ».

Global Pulse se limite à apporter des éléments d’arbitrage temps réel. Ceci dans une perspective préventive à seule finalité unique de politique humanitaire (« analyse du chômage à travers les conversations dans les réseaux sociaux, prévention de crises alimentaires, suivi global de l'état sanitaire d'une population, analyse de migration de population, anticipation d’inflation de denrées alimentaires, etc »).

Nous ne pouvons que saluer ce projet. Croisons les doigts pour que ce type d’initiative analytique renvoie les « méthodologies » prédictives et les grilles de lecture d’Alain Minc et autres Jacques Attali (les Paco Rabanne de la finance, de la crise et du chômage) à leurs chères études
.
  

Autre illustration connexe, Google Flu permet quant à lui de tracker la propagation de la grippe. A contrario et sur une dimension plus marchande, on suivra attentivement le lancement de Facebook Graph Search. Nouveau mécanisme d’indexation qui s’appuiera sur les technologies du Big Data et fera écho aux requêtes de combinaisons croisées. Quel est le restaurant de tapas le plus apprécié de mes amis de moins de 30 ans habitant sur Paris.  Avec la légitimité et l’appréciation de votre cercle relationnel en prime. De quoi bouleverser sensiblement les ratios transactionnels d’acte d’achat généralement observés..

Plus d’illustration, de pragmatisme ? Cela fera l’objet d’un prochain billet Big Data à la sauce française avec la mise en relief de certaines solutions de start up françaises. En effet, une myriade de start up dans le monde essaye de se positionner sur le trend.