Instal tools analisa dinamis: x64dbg (atau OllyDbg untuk 32-bit), WinDbg.
Setel adaptor jaringan VM ke mode Host-Only atau Isolated Network (terputus dari internet). JANGAN gunakan mode NAT/Bridged.
Buat snapshot (titik pemulihan) setelah instalasi OS dan alat.
Alternatif bisa menggunakan tools online seperti Virustotal, Hybrid Analysis, Any.run
Kerjakan Lab 01 RPISEC dari link berikut: https://github.com/RPISEC/Malware/tree/master/Labs/Lab_01 ; instruksi bisa dilihat di file pdf, sampel bisa dilihat di file zip
Tutorial bisa dilihat di lecturer berikut : https://github.com/RPISEC/Malware/tree/master/Lectures/01_Introduction_and_Basic_Analysis
Malware is getting smarter, and traditional detection often struggle to keep up. Most malware detection rely on just on type of data. But what if we could use multiple types of data to get a clearer picture of malware.
That’s exactly MIDALF (Multimodal Image and Audio Late Fusion for malware detection does. Our newly published research introduces a fresh approach to malware detection by combining image and audio representation to improve accuracy.
How does MIDALF work?
Instead of just looking at malware as a raw code, we transfoem it into two different formats: Images and Audio. We then use Self-supervised learning (SSL) and convolutional neural network (CNN) to extract useful patterns. Finally, we combine the insights from Image and Audio rerpesentation with late fusion to make better decision whether a file is malicious or not.
Why is this important?
Better detection – by using two different views of malware representation, we can catch threats that might slip past traditional methods
Less reliance on labeled data – SSL helps learn useful features without needing tons of labeled malware samples
Harder to evade – malware authors often try to bypass detection, but combining multiple data types makes that much more difficult.
Paper kami tentang teknik deteksi malware menggunakan multimodal baru saja terbit. Pada paper ini kami mengembangkan metode deteksi malware dengan menggunakan teknik multimodal. Silahkan akses pada link berikut. https://rdcu.be/eaq8k
Minggu ini saya diminta mengumpulkan berkas-berkas revisi dan yudisium. Banyak juga berkas yang harus disiapkan. Salah satunya adalah membuat poster tentang penelitian saya. Ternyata gak gampang buat bikin poster penelitian. Ada 3 hari juga yang saya habiskan buat bikin poster ini (kelamaan galaunya). Setelah baca2 dan nonton beberapa video akhirnya saya tertarik dengan idenya Mike Morisson “Better Poster”. Dia punya beberapa ide untuk bikin poster yang menarik dan gak boring. Menurut dia, poster tuh jangan banyak tulisan, minimalis dan eye catching. Trus ada qr-code buat nampilin info lebih lanjut. Ternyata gak gampang buat ikutin sarannya dia. Walaupun saya udah pake template poster dia, cuman tetep aja susah buat ngilangin berbagai tulisan tentang penelitian saya. Jadinya beginilah poster yang saya buat.
poster penelitian teknik deteksi malware dengan ssl dan multimodal
Gimana? kayaknya masih terlalu banyak tulisan ya? buat yang tertarik dengan konsep better-posternya om morisson bisa dilihat videonya disini:
Malware has become a serious threat to the internet. According to antivirus company McAfee, an average of 588 malware attacks occurs every minute. The LockBit ransomware infected Indonesia National Data Center and caused the downtime of 282 Indonesian government institutions’ services for more than a week. Malware also caused economic losses. During 2023, it was reported that $1.1 trillion in ransomware payments were made.
To detect malware, antivirus still relies on signature-based and heuristic-based detection techniques. This technique is effective for detecting malware. However, malware signatures and heuristic rules are compiled by malware analysts manually. It takes time and special skills to detect malware and create a signature. With the growing number of malwares, an automatic malware detection process is required. For this reason, machine learning technology is implemented for malware detection. With machine learning, the malware detection process is carried out automatically. However, the implementation of machine learning on malware detection still faces several problems. First the dataset labeling process takes a significant amount of time. Second, machine learning is not yet capable of detecting new malware. This highlights the need for a new malware detection method.
In this study, a new malware detection method using machine learning is proposed to address these problems. The approach involves developing new detection techniques based on self-supervised learning methods and a multimodal architecture. Self-supervised learning techniques, which have been successfully applied in computer vision, achieve competitive results with supervised learning techniques but do not require an extensive labeling process.
A novel malware detection method based on self-supervised has been developed, eliminating the need for a large labeling process. New malware was detected using multimodal methods. Malware files were converted into images, and their patterns were analyzed. Assuming that new malware reused code from known malware, the multimodal identified new malware by recognizing patterns from previously identified malware. The multimodal architecture combines two malware detection methods: one using image representations and the other using audio representations.
The development of the proposed malware detection method is divided into three stages. The first stage involves developing a malware detection method using an image-based representation method with self-supervised learning (SSL). The second stage focuses on the development of a malware detection method utilizing audio representation with convolutional neural network (CNN). Finally, the third stage involves the development of multimodal architecture. The methods for all three stages are conducted using an experimental approach.
The novelty of this research lies in the development of MalSSL, a malware detection method that does not require an extensive labeling process and multimodal approach to recognize new malware. MalSSL, the proposed method based on self-supervised learning and image representation, achieves malware classification accuracy of 98.4% without the need for labeling. The multimodal architecture, which combines image and audio representations using a late fusion approach, can detect new malware variants with an accuracy of 95.1%. Additionally, it achieves an accuracy of 99.7% in classifying known malware.
Rabu kemaren saya diminta mas Hatma senpai buat ngasih guest lecture kuliah manajemen insiden keamanan siber. Kuliahnya tentang pengenalan malware. Seru juga, ada banyak pertanyaan, diantaranya ada yang nanya tentang antivirus, tentang anaisa statik dll. Slidenya bisa dilihat disini
Saya lagi baca paper Wei Wang dkk tentang klasifikasi trafik malware pake CNN. Judul lengkapnya malware traffic classification using CNN for representation learning. Jadi dia bikin taksonomi klasifikasi trafik dengan AI, kemudian mengajukan metode klasifikasi trafik malware pake CNN dengan mengubah data trafik jadi image. Jadi dia ngambil trafik jaringan (raw) sebagai input trus diklasifikasikan dengan CNN. Dia melakukan 8 eksperimen dan berpendapat representasi trafik yang terbaik dalam bentuk sessionpada semua layer. Pengujiannya ada 2 skenario, dengan 3 klasifer berbeda. Akurasi rata-rata 99,41%
Dari hasil review yang mereka lakukan, metode klasifikasi trafik mereka bagi 4: 1) berbasis port, 2) dpi (deep-packet instection), 3) statistik dan 4) behavior. Port based dan DPI itu menggunakan pendekatan rule-based yaitu melakukan klasifikasi dengan mengunakan hard-coded rules. Sementara statistik dan behavior menggunakan pendekatan mesin learning. Kelebihan pendekatan mesin learning dapat menangani beberapa masalah di metode rule based, seperti klasifikasi encrypted traffic, dan kebutuhan komputasi tinggi.
Terus dia cerita tentang representation learning, yaitu ekstrak fitur langsung dari data secara otomatis. Mereka bikin dataset trafik USTC-TFC2016, dan bikin tools pemrosesan data USTC-TK2016.
Daftar related work:
Finterbusch dkk tentang klasifikasi trafik berbasis DPI
Di papernya mereka juga bilang dataset buat klasifikasi trafik masih dikit. Yang sering dipake KDD CUP1999 dan NSL-KDD. Dataset ini pake 41 fitur yang udah diekstrak dari trafik.
Jadinya mereka bikin dataset sendiri USTC-TFC2016. Dataset ini dibagi 2, bagian 1 isinya 10 jenis trafik malware dari web publik yang dikumpulkan dari peneliti CTU dari jaringan pada tahun 2011 – 2015. Malwarenya: cridex, geodo, Htbot, Miuref, Neris, Nsis-ay, shifu, Tinba, Virut dan Zeus. Kalo trafiknya terlalu besar, mereka cuman pake bagian tertentu. Sementara kalo trafiknya terlalu kecil digabungin.
Bagian 2 isinya 10 jenis trafik normal yang dikumpulkan pake IXIA BPS (simulator). Trafik ini memiliki 8 kelas aplikasi yang umum digunakan,(BitTorent, Facetime,FTP, GMail, MySQL, Outlook, Skype, SMB, Weibo, WorldOfWarcraft). Ukuran dataset USTC-TFC2016 dataset adalah 3,71GB, dengan format pcap.
Klasifikasi trafik berbasis ML harus membagi data kontinu jadi banyak unit diskret berdasarkan aturan tertentu. Selain itu model OSI maupun layer TCP/IP bisa dipilih untuk setiap paket.
Contoh pembagiannya misalnya berdasarkan granularity seperti: koneksi TCP, flow, session, service, dan host. Perbedaan pembagian akan menghasilkan unit trafik yang berbeda. Mereka menggunakan flow dan session.
Flow itu memiliki 5-tuple yang sama misalnya:
source IP
source port
destination IP
destination port
transport-level protocol
Session adalah flow dua arah termasuk 2 arah dari trafik.
Semua paket didefinisikan sebagai set P={p1 ,…, p|P| }.
Dan setiap paket didefinisikan sebagai pi=(xi,bi,ti) ; i=1,2,…,|P|
Elemen pertama dari xi adalah 5-tuple diatas, elemen kedua adalah ukuran paket bi elemen [0, tak hingga) dalam byte. Elemen terakhir adalah waktu awal transmisi ti elemen [0, tak hingga] dalam detik.
Flow: adalah kumpulan trafik P yang dapat dibagi menjadi banyak subset. Semua paket dalam sebuah subset diatur berurutan waktu: {p1 = (x1,b1,t1),…,pn =(xn,bn,tn)}, t1 <t2 <…<tn
Sebuah subset adalah sebuah flow f = (x,b,dt ,t).
Elemen pertama adalah 5 tuple yang sama, contohnya x = x1 =..= xn .
Elemen kedua adalah jumlah ukuran semua paket dalam flow.
Elemen ketiga adalah durasi flowdt = t^n- t^1.
Elemen terakhir adalah waktu awal transmisi dari paket pertama. Keseluruhan trafik raw bisa dikonvert jadi flow F={f^1,…,f^n}
Session isinya dua arah flow misalnya source and destination IP / port.
Flows maupun sessions yang berbeda bisa memiliki ukuran yang berbeda. Sementara ukuran input CNN harus sama, sehingga mereka cuman pake n=784 bute pertama pada setiap flow/session. Alasannya karena bagian depan dari flow/session biasanya mengandung koneksi data dan sedikit konten.
Saya masih belajar tentang ransomware. Kali ini ada tulisan menarik dari Chad Anderson, beliau peneliti dari perusahaan domaintools. Dia cerita tentang 3 family ransomware yang lagi trending. Semakin banyak bermunculan geng ransomware. Geng ransomware dan grup afiliasinya bekerjasama juga dengan operator botnet. Setelah mereka menguasai jaringan korban, operator botnet menjual akses korban ke grup ransomware. Contohnya infeksi Trickbot seringkali diikuti dengan serangan ransomware Conti atau Ryuk. Kasus lainnya infeksi Qakbot diikuti dengan serangan ransomware REvil.
Menurut Chad ada 3 family ransomware yang paling banyak korbannya, yaitu conti, maze dan Sodinokibi. Geng ransomware ini seringkali saling bekerjasama, berbagai tools, dan saling menjual akses ke korban. Biasanya ada tool builder yang dapat digunakan grup afiliasi untuk melakukan kastemisasi ransomware, disesuaikan dengan targetnya, serta melakukan evasion deteksi antivirus.
Akses awal ke komputer korban biasanya menggunakan backdoor atau botnet, istilahnya initial access broker. Backdoor ini bisa juga disebut RAT (Remote access trojan) menginfeksi korban melalui downloader. Downloader ini tools yang disebar melalui email spam yang mengandung dokumen malicious dengan tipe yang berbeda. Ada juga RAT yang menginfeksi menggunakan teknik cracking password atau eksploitasi celah keamanan yang ada di jaringan target.
Conti
Mulai ditemukan pada desember 2019, konon operator Conti sama dengan Ryuk. Ransomware ini memiliki infeksi awal yang cepat. Conti menjalankan layanan Raas, dan memiliki leak site yang digunakan untuk strategi double extortion (pemerasan). Awalnya didistribusikan dengan botnet Trickbot, namun kemudian menggunakan Bazar dan IcedID (Bokbot). IcedID ini digunakan juga oleh botnet Emotet yang menyebarkan Trickbot dan Ryuk dimasa lalu.
Conti menggunakan enkripsi AES256 yang menggunakan pendekatan multithread sehingga eksekusinya jauh lebih cepat dibandingkan malware lainnya. Teknik ini digunakan juga Ryuk sejak 2018. Conti konon lebih kompleks dibandingkan grup lainnya.
Bazar menggunakan EmerDNS domain berbasis blockchain, sebuah register domain alternatif yang menggunakan EmerCoin sebagai blockchain, sehingga domainnya tidak bisa di-take down atau sinkholed.
Maze dan Egregor
Grup Maze menjadi salah satu afiliasi ransomware yang memiliki jumlah infeksi tinggi. Bahkan masih menempati peringkat infeksi tertinggi, walaupun grup ini sudah menutup operasinya pada november 2020. Maze dulu dikenal sebagai grup ChaCha, karena menggunakan algoritma enkripsi ChaCha. Grup ini salah satu Raas yang menggunakan leak site. Setelah Maze berhenti, grup afiliasinya banyak menggunakan ransomware Egregor.
Maze menggunakan tools eksploit kit seperti fallout atau spelevo. Mereka juga menggunakan kampanye spam yang menginstal Cobalt Strike Beacon. Beacon adalah RAT komersial dengan fitur lengkap, yang ditemukan pada hampir semua infection chain. Walaupun awalnya dibuat untuk pentest dan red teams, Cobalt Strike banyak digunakan oleh geng ransomware, karena memiliki fitur yang langkap, khususnya fitur c&c di beacon.
Berbeda dengan Maze, Egregor meggunakan eksploit eksternal terhadap RDP seperti conti, dan email spam dengan dokumen malicious yang memasang worm Qakbot (Qbot). Qakbot adalah malware yang sudah ada sejak 2007. Qakbot pernah digunakan juga oleh Emotet, ProLock dan LockerGoga.
Revil
REvil mulai dikenal sejal april 2019, diduga adalah penerus GandCrab, karena kesamaan kodenya. GanCrab adalah varian ransomware awal. REvil memeriksa settingan regional dan bahasa komputer, apakah berada di negara2 berbahasa rusia. REvil memiliki sebuah leak site juga, diantaranya membocorkan blueprints Apple. Revil memiliki beberapa fitur unik, diantaranya privilege escalation dengan melakukan spam pada user yang tidak memiliki login administrator, atau melakukan reboot komputer ke Safe Mode untuk mengenkripsi file. Alasanya karena antivirus umumnya tidak berjaan di sage mode.
Mereka menggunakan packer custom, yang menggunakan teknik obfuscation. Algoritma enkripsi menggunakan AES atau Salsa20. Pecahan ransomware ini diantaranya geng Prometheus.
Distribusi menggunakan spam untuk menyebarkan dokumen malicious dan ekspoit kit yang menyerang celah keamanan yang tidak dipatch, selain itu ada juga yang menggunakan Qakbot.
Tulisan lengkapnya bisa dilihat pada link berikut:
Saya lagi baca tulisan Oleg Skulkin tentang revil ransomware. Revil ini salah satu ransomware yang pake model Raas (ransomware as a service). Model Raas ini si developer malware dia ngejual atau nyewain ransomware yang dia bikin. Raas ini konon jadi salah satu faktor yang menyebabkan pertumbuhan ransomware yang sangat pesat. Menurut tim Group-IB sekitar 64% serangan ransomware tahun 2020 pake model Raas.
REvil alias Sodinokibi atau Sodin mulai dikenal sejak tahun 2019. Konon developer grup revil ini dari negara berbahasa rusia. Beberapa korbannya diantaranya perusahaan besar seperti Acer, Honeywell, Quanta Computer, JBS, Sol Oriens. Permintaan ransomnya konon sebesar USD 50 juta untuk dan USD 11 juta untuk JBS.
Menurut oleg, akses awal REvil umumnya melalui serangan brute force terhadap RDP server publik atau menggunakan akun yang didapat dari pihak ketiga. Mereka menemukan juga varian REvil yang menggunakan malvertising dengan mengelabui korban untuk mengunduh file arcive yang mengandung file JS malicious. Ketika dijalankan malware menjalankan perintah Powershell, sehingga REvil dapat jalan pada komputer korban. Teknik ini digunakan juga pada Trojan Gootkit.
Untuk mendeteksi REvil menurut oleg selalu monitor WScript.exe yang menjalankan skrip dari lokasi yang tidak umum. Selain itu juga monitor file WScript.exe yang menjalankan cmd.exe atau powershell.exe atau yang meminta akses ke jaringan eksternal.
Tips lainya monitor winword.exe atau exel.exe yang menjalankan proses mencurigakan seperti rundll32.exe, regsvr32.exe atau mshta.exe
Penjelasan lainnya tentang revil dan tips deteksi lainnya bisa dilihat pada blog berikut:
Saya baru nonton podcast tentang ransomware dari sans. Di video itu Katie Nichols, instruktur sans cerita banyak tentang ransomware bersama dengan Ryan Chapman. Ryan ini instruktur sans juga, dia ngajar kursus Ransomware for Incident Responders. Videonya bisa dilihat disini:
Terus mereka share juga tentang beberapa tools open source dan website menarik yang mereka pake buat memantau perkembangan ransomware terbaru. Toolsnya mereka share di blog berikut ini:
Buat yang lagi belajar analisa malware ada tools menarik namanya dotnetfile. Tools ini CLR header parser buat file .NET. CLR itu common language runtime. CLR header ini ada disetiap files .NET selain PE HEader. CLR header ini isinya informasi metadata tentang file.
Jadi tools ini kayak tools PEfile, tapi khususon buat file .NET. Tools ini dikembangkan sama tim palo alto . Awalnya cuman buat internal mereka, tapi sekarang udah dishare ke publik. Toolsnya bisa diunduh disini: