Accueil Finances personnelles Extraction de données pour Big Data - les nuls

Extraction de données pour Big Data - les nuls

Vidéo: How To Cloud - Big Data, Ep 4.2 : Outils Datawiz - FR 2025

Vidéo: How To Cloud - Big Data, Ep 4.2 : Outils Datawiz - FR 2025
Anonim

L'extraction de données implique l'exploration et l'analyse de grandes quantités de données pour trouver des modèles pour les mégadonnées. Les techniques sont issues des domaines de la statistique et de l'intelligence artificielle (IA), avec un peu de gestion de base de données dans le mix.

Généralement, l'objectif de l'exploration de données est la classification ou la prédiction. En classification, l'idée est de trier les données en groupes. Par exemple, un agent de commercialisation pourrait être intéressé par les caractéristiques de ceux qui ont répondu par rapport à ceux qui n'ont pas répondu à une promotion.

Ce sont deux classes. En prédiction, l'idée est de prédire la valeur d'une variable continue. Par exemple, un agent de commercialisation pourrait être intéressé à prédire ceux qui répondront à une promotion.

Les algorithmes typiques utilisés dans l'exploration de données sont les suivants:

  • Arbres de classification: Technique d'exploration de données populaire utilisée pour classer une variable catégorielle dépendante basée sur des mesures d'une ou de plusieurs variables prédictives. Le résultat est un arbre avec des nœuds et des liens entre les nœuds qui peuvent être lus pour former des règles if-then.

  • Régression logistique: Une technique statistique qui est une variante de la régression standard mais qui étend le concept à la classification. Il produit une formule qui prédit la probabilité de l'occurrence en fonction des variables indépendantes.

  • Réseaux de neurones: Algorithme logiciel modélisé d'après l'architecture parallèle des cerveaux animaux. Le réseau se compose de noeuds d'entrée, de couches masquées et de noeuds de sortie. Chaque unité reçoit un poids. Les données sont données au noeud d'entrée, et par un système d'essais et d'erreurs, l'algorithme ajuste les poids jusqu'à ce qu'il rencontre un certain critère d'arrêt. Certaines personnes ont comparé cela à une approche de boîte noire.

  • Techniques de clustering comme les voisins K-plus proches: Technique qui identifie des groupes d'enregistrements similaires. La technique K-plus proche voisin calcule les distances entre l'enregistrement et les points dans les données historiques (formation). Il affecte ensuite cet enregistrement à la classe de son voisin le plus proche dans un ensemble de données.

Voici un exemple d'arbre de classification. Considérons la situation où une compagnie de téléphone veut déterminer quels clients résidentiels sont susceptibles de déconnecter leur service.

La compagnie de téléphone a des informations qui comprennent les attributs suivants: combien de temps la personne a eu le service, combien il dépense pour le service, si le service a été problématique, s'il a le meilleur plan d'appel dont il a besoin, vit, quel âge il a, s'il a d'autres services groupés, de l'information concurrentielle sur les plans des autres transporteurs et s'il a toujours le service.

Bien sûr, vous pouvez trouver beaucoup plus d'attributs que celui-ci. Le dernier attribut est la variable de résultat; c'est ce que le logiciel utilisera pour classer les clients dans l'un des deux groupes - peut-être appelés stayers et risques de vol.

Le jeu de données est divisé en données d'apprentissage et en jeu de données de test. Les données d'apprentissage sont constituées d'observations (appelées attributs) et d'une variable de résultat (binaire dans le cas d'un modèle de classification) - dans ce cas, les stayers ou les risques de vol.

L'algorithme est exécuté sur les données d'apprentissage et génère un arbre qui peut être lu comme une série de règles. Par exemple, si les clients sont dans l'entreprise depuis plus de dix ans et ont plus de 55 ans, ils resteront probablement des clients fidèles.

Ces règles sont ensuite exécutées sur l'ensemble de données de test pour déterminer la qualité de ce modèle sur les «nouvelles données». "Des mesures de précision sont fournies pour le modèle. Par exemple, une technique populaire est la matrice de confusion. Cette matrice est un tableau qui fournit des informations sur le nombre de cas classés correctement ou incorrectement.

Si le modèle a l'air bien, il peut être déployé sur d'autres données, car il est disponible (c'est-à-dire, l'utiliser pour prédire de nouveaux cas de risque de vol). Sur la base de ce modèle, l'entreprise pourrait décider, par exemple, d'envoyer des offres spéciales aux clients qu'elle estime être des risques de vol.

Extraction de données pour Big Data - les nuls

Le choix des éditeurs

Principes de base du protocole de routage IP Multicast - dummies

Principes de base du protocole de routage IP Multicast - dummies

IP Le routage multicast est le routage du trafic multicast. La nature des données IP Multicast est telle qu'elle a ses propres problèmes de routage de réseau Cisco. Il existe quatre protocoles de multidiffusion principaux pris en charge par le Cisco IOS actuel. L'illustration vous montre approximativement où les protocoles sont utilisés; Ce qui suit est ...

Comment le protocole STP (Spanning Tree Protocol) gère les modifications du réseau - dummies

Comment le protocole STP (Spanning Tree Protocol) gère les modifications du réseau - dummies

Nouveau concentrateur ou passer à un réseau mappé STP (Spanning Tree Protocol)? Pour cet exemple, un concentrateur était connecté à un port sur les deux commutateurs 11: 99 et 77: 22. Un concentrateur était utilisé car il ne disposait pas d'une intelligence réseau. L'effet net est en fait le même que ...

Types de réseau local (LAN) - nuls

Types de réseau local (LAN) - nuls

Un WAN est un type de réseau local (LAN) . Un réseau local est un réseau privé généralement constitué d'une connexion réseau fiable, rapide et bien connectée. Les alternatives sur le framework LAN incluent CAN, MAN et WAN. Ces trois options de réseau sont illustrées ci-dessous: CAN Si vous utilisez le réseau LAN ...

Le choix des éditeurs

Bebo est l'application de médias sociaux pour vous? - les nuls

Bebo est l'application de médias sociaux pour vous? - les nuls

Comment savez-vous quel est le bon média social pour vous? La culture moderne devient de plus en plus dépendante des médias sociaux tels que Bebo, Facebook, Twitter et What'sApp, ainsi que de nombreux autres. Le questionnaire suivant vous aidera à déterminer si vous avez ou non ce qu'il faut pour être social sur le nouveau ...

Comment utiliser Bebo - dummies

Comment utiliser Bebo - dummies

Bebo, la nouvelle application des médias sociaux, est aussi facile à utiliser que C'est amusant à regarder. Vous pouvez obtenir cette nouvelle application sur Google Play Store et Apple App Store. Lancez Bebo et suivez les instructions à l'écran pour terminer le processus de création de compte. Après avoir téléchargé avec succès, ...

Le choix des éditeurs

Ce que vous pouvez trouver dans une barre latérale de blog - des mannequins

Ce que vous pouvez trouver dans une barre latérale de blog - des mannequins

La plupart des blogs contiennent du matériel de barre latérale. La plupart des blogs sont disposés en deux ou trois colonnes, et le contenu de la barre latérale apparaît généralement dans les deuxième et / ou troisième colonnes. Certains blogs n'ont pas de barres latérales, et sur d'autres blogs, vous pouvez découvrir des éléments supplémentaires au-delà de ce que vous voyez ici. Archives basées sur la date: Presque tous les blogs sont ...

Lorsqu'un réseau publicitaire est approprié pour votre blog maman - les mannequins

Lorsqu'un réseau publicitaire est approprié pour votre blog maman - les mannequins

Ne sont que quelques-unes modèles conflit en cours d'exécution des publicités avec vos meilleurs intérêts. C'est quand vous bloguez pour vendre vos propres produits ou pour promouvoir vos services professionnels. Même dans ce cas, il est toujours possible de diffuser des annonces sur ces blogs, surtout si les annonces font la promotion de produits et de services complémentaires et non concurrents. Mais si vous êtes ...

Quand maman blogue pour Swag is Okay - les mannequins

Quand maman blogue pour Swag is Okay - les mannequins

Dans certaines circonstances légitimes vous pouvez vous sentir travailler gratuitement vaut votre temps et la publicité que vous offrez à une marque. Cela peut être comparé à un stage non rémunéré. Si vous êtes stagiaire et que vous avez une excellente expérience de travail, alors c'est une entreprise précieuse. Si vous êtes stagiaire et que vous ne versez que du café et que vous livrez ...