Machine Learning en Python : clusterisation à la rescousse des hunters (de malwares)

MISC

HS n°

novembre 2018

Par

Tag(s)

Machine Learning

Threat Intelligence

Clusterisation

Yara

Windows

Cet article présente des techniques de clusterisation (classification automatique) de malwares pour se faciliter la vie dans l’écriture de règles Yara. Cela permet de diminuer fortement le taux de faux positifs. On commence par clusteriser notre ensemble de malwares, et, pour chaque cluster nous utilisons un générateur automatique de règles Yara. Nous donnons des exemples avec le jeu de données « theZoo ».

Le Machine Learning est une expression utilisée à tort et à travers dans beaucoup de domaines et l’analyse de malwares n’est pas épargnée. Mais correctement utilisés, les algorithmes du Machine Learning peuvent générer un gain de temps non négligeable, par exemple pour les analystes de malwares, pour comprendre une grande masse de données, sélectionner des fichiers ayant un profil particulier, et surtout : calculer des ensembles/clusters de fichiers ayant les mêmes propriétés. Pourquoi clusteriser un ensemble de malwares ? Par exemple, c’est ce que nous allons montrer dans cet article, pour générer des règles Yara sur ces familles ! Cela va permettre de faire du huntingen réponse sur incident, mais aussi en source ouverte pour découvrir de nouvelles souches d’une même famille. Dans cet article, nous présentons les différentes étapes pour générer des règles Yara sur des malwares, tous des exécutables Windows faisant partie du jeu de données TheZoo.

1…

La suite est réservée aux abonnés. Il vous reste 96% à découvrir.

Déjà abonné ? Se connecter

Accédez à tous les contenus de Connect en illimité
Découvrez des listes de lecture et des contenus Premium
Consultez les nouveaux articles en avant-première

Envie de lire la suite ? Rejoignez Connect

Je m'abonne maintenant

Références

[Corkami] https://github.com/corkami/pics/blob/master/binary/pe101/pe101.svg

[Pefile] https://github.com/erocarrera/pefile

[LIEF] https://github.com/lief-project/LIEF

[ssdeep] https://ssdeep-project.github.io/ssdeep/index.html

[ssdeep_for] http://dfrws.org/sites/default/files/session-files/paper-identifying_almost_identical_files_using_context_triggered_piecewise_hashing.pdf

[pehash] https://www.usenix.org/legacy/events/leet09/tech/full_papers/wicherski/wicherski_html/index.html

[imphash] https://www.fireeye.com/blog/threat-research/2014/01/tracking-malware-import-hashing.html

[tinynuke] https://github.com/rossja/TinyNuke

[impfuzzy] https://blog.jpcert.or.jp/2016/05/classifying-mal-a988.html

[impfuzzy_clust] https://blog.jpcert.or.jp/2017/03/malware-clustering-using-impfuzzy-and-network-analysis---impfuzzy-for-neo4j-.html

[polichombr] https://github.com/ANSSI-FR/polichombr

[machoke] https://github.com/conix-security/machoke

[Scikit] http://scikit-learn.org/stable/

[theZoo] https://github.com/ytisf/theZoo

[YaraGen] https://github.com/Xen0ph0n/YaraGenerator/

[Yar] http://virustotal.github.io/yara/

Article rédigé par

Larinier Sébastien

6 articles

Par le(s) même(s) auteur(s)

Plus d'article de cet auteur

Réponse à incidents et investigation numérique en open source

GNU/Linux Magazine

HS n°

janvier 2015

Par

Cet article est une introduction à la démarche RI&IN : « Réponse à Incidents et Investigation Numérique ». Nous présentons les bonnes pratiques en matière de réaction à une compromission et les principaux logiciels libres/open source ou gratuits qui seront vos meilleurs atouts pour mener à bien vos analyses « inforensiques ».

Lire l'article

OPSEC et Botnets

MISC

HS n°

octobre 2013

Par

Il est une catégorie d’internautes que l’on imagine plus soucieuse que les autres de la protection de sa vie privée et de son anonymat : les cybercriminels. Ils évoluent en effet dans un environnement qui leur est particulièrement inhospitalier sinon hostile et doivent faire face à des adversaires résolus et obstinés : services de police nationaux et internationaux, équipes de réponse à incident, CERT, chercheurs en sécurité professionnels ou « amateurs », groupes cybercriminels concurrents, etc.Nous nous proposons de décrire dans cet article comment les cybercriminels construisent leurs politiques de sécurité afin de protéger leur « business » et leur identité, comment ils y parviennent et comment ils échouent parfois.

Lire l'article

Et vous, vous avez quoi dans vos logs ?

MISC

n°

septembre 2013

Par

Les auteurs ont collaboré sur un projet SIEM « Infrastructures » pour un grand groupe français, pendant plusieurs années. Ce retour d'expérience met en exergue les facteurs de réussite, qu'ils soient techniques ou organisationnels. Cet article est garanti « 100 % product-less » ;-)

Lire l'article

Obfuscation de langage interprété : « Cachez ce code que je ne saurais voir »

MISC

HS n°

mai 2013

Par

Cet article aborde l’obfuscation de langage interprété (Java/JavaScript, Perl, PHP). Dans un premier temps, il détaille ce que nous entendons par obfuscation, les techniques utilisées et les buts recherchés, que ce soit du point de vue de l’attaquant ou de celui du défenseur. Ensuite, cet article détaille des cas d’usage avant d’apporter des pistes sur la détection de code obfusqué et sa désobfuscation.

Lire l'article

Les listes de lecture

Python niveau débutant

9 article(s) - ajoutée le 01/07/2020

Code

Vous désirez apprendre le langage Python, mais ne savez pas trop par où commencer ? Cette liste de lecture vous permettra de faire vos premiers pas en découvrant l'écosystème de Python et en écrivant de petits scripts.

Au pays des algorithmes

11 article(s) - ajoutée le 01/07/2020

Algo

La base de tout programme effectuant une tâche un tant soit peu complexe est un algorithme, une méthode permettant de manipuler des données pour obtenir un résultat attendu. Dans cette liste, vous pourrez découvrir quelques spécimens d'algorithmes.

Analyse de données en Python

10 article(s) - ajoutée le 01/07/2020

Code

À quoi bon se targuer de posséder des pétaoctets de données si l'on est incapable d'analyser ces dernières ? Cette liste vous aidera à "faire parler" vos données.

Plus de listes de lecture