Pelajari cara membuat work sample test yang relevan dengan pekerjaan, menentukan tugas dan durasi, membuat scoring rubric, mengatur penggunaan AI, serta menilai kandidat secara konsisten.

Work sample test sering dianggap sederhana: berikan kandidat sebuah tugas, lihat hasilnya, lalu pilih yang paling bagus. Dalam praktiknya, desain seperti itu justru mudah menghasilkan assignment yang terlalu besar, scoring yang subjektif, dan output yang sulit dibandingkan antar-kandidat. Masalahnya bukan pada metode work sample itu sendiri, tetapi pada bagaimana tugas, kondisi pengerjaan, dan cara penilaiannya dirancang.
Work sample test yang baik bukan tugas yang paling sulit atau yang mencoba mensimulasikan seluruh pekerjaan. Tujuannya adalah mengambil bagian pekerjaan yang cukup representatif untuk memunculkan evidence tentang competency penting, tetap proporsional bagi kandidat, dan dapat dinilai menggunakan criteria yang konsisten. Dalam recruitment workflow, hasilnya sebaiknya menjadi salah satu sumber evidence bersama screening, interview, atau assessment lain yang memang relevan.
Work sample test meminta kandidat melakukan tugas terstandar yang mewakili bagian penting dari pekerjaan target. Contohnya, Data Analyst menginterpretasikan dataset, Developer memperbaiki bug, Copywriter mengedit landing page, atau kandidat Sales menjalankan discovery conversation. Kandidat tidak hanya menjelaskan apa yang mereka ketahui, tetapi menunjukkan bagaimana mereka menerapkan kemampuan tersebut pada tugas yang menyerupai pekerjaan.
Definisi ini sejalan dengan prinsip personnel selection dari SIOP, yang menekankan hubungan antara selection procedure, construct yang relevan terhadap pekerjaan, dan inference yang ingin dibuat dari hasilnya. Guidance dari Public Service Commission of Canada juga menempatkan simulation exercise sebagai cara meminta kandidat mendemonstrasikan actual job atau job-task performance. Nama “work sample” sendiri tidak menjamin kualitas assessment jika tugas dan scoring-nya tidak mendukung inference yang ingin dibuat.
Work sample yang baik setidaknya mempunyai tiga unsur: tugas yang relevan dengan pekerjaan, kondisi pelaksanaan yang cukup terstandar, dan scoring rubric yang sudah ditentukan sebelum hasil kandidat dilihat. Ketiganya membantu recruiter membandingkan kandidat berdasarkan evidence yang lebih seragam. Namun standardization tetap perlu mengakomodasi penyesuaian yang sah ketika candidate accessibility memang membutuhkannya.
Bayangkan CV kandidat menyebutkan bahwa ia mempunyai “strong analytical skills”. Recruiter masih harus menyimpulkan kemampuan tersebut dari claim kandidat, deskripsi pengalaman, atau contoh yang ia ceritakan dalam interview. Evidence-nya masih mempunyai jarak dari perilaku kerja yang sebenarnya ingin dilihat.
Dengan work sample, kandidat dapat diminta menganalisis dataset dan membuat rekomendasi berdasarkan informasi yang tersedia. Recruiter kemudian dapat melihat bagaimana kandidat memilah informasi, membuat asumsi, mengambil keputusan, dan menjelaskan alasannya. Jarak antara evidence dan perilaku kerja yang ingin dinilai menjadi lebih pendek, meskipun satu tugas tetap tidak sama dengan actual job performance selama berbulan-bulan.
Angka validity yang sering dikutip untuk work sample juga perlu dibaca dengan hati-hati. Estimasi klasik yang sering dikaitkan dengan Schmidt & Hunter (1998), sekitar r≈.54, tidak sebaiknya digunakan sebagai universal benchmark untuk setiap work sample; Sackett et al. (2022) meninjau ulang sejumlah meta-analytic validity estimates dan menempatkan estimasi work sample lebih rendah, sekitar .33 dalam sintesis tersebut. Analisis lanjutan oleh Sackett et al. (2023) tetap menunjukkan work sample sebagai predictor yang berguna dalam konteks tertentu, tetapi bukan berarti setiap work sample mempunyai validity .33 atau “33% akurat”.
Artinya, kekuatan work sample bukan berasal dari satu angka validity universal. Kualitas evidence tetap bergantung pada apa yang disampel, bagaimana tugas diberikan, bagaimana hasil dinilai, siapa kandidatnya, dan criterion apa yang ingin diprediksi. Studi work sample yang lebih baru, seperti penelitian Sjöberg et al. (2024), juga menegaskan pentingnya menilai validity pada task dan criterion yang spesifik.
Kesalahan umum dalam work sample test adalah menganggap semakin besar dan realistis assignment, semakin baik assessment-nya. Padahal recruiter hanya perlu memperoleh sampel perilaku yang cukup untuk menjawab hiring question tertentu. Mensimulasikan seluruh pekerjaan sering menambah beban kandidat tanpa otomatis memberikan evidence yang lebih berguna.
Untuk Product Marketer, misalnya, assignment “buat complete go-to-market strategy untuk produk kami” terlalu luas jika tujuan assessment hanya ingin melihat kemampuan segment prioritization dan positioning. Tugas yang lebih proporsional dapat meminta kandidat membaca synthetic product brief dan customer evidence, memilih priority segment, membuat positioning hypothesis, lalu memberikan beberapa launch recommendations beserta alasannya. Versi kedua tetap memperlihatkan synthesis, prioritization, dan strategic reasoning tanpa berubah menjadi proyek konsultasi penuh.
Prinsip yang lebih berguna adalah minimum representative task. Cari tugas terkecil yang masih mampu memunculkan perilaku penting dan menghasilkan evidence yang dapat dinilai. SIOP Principles mendukung logika bahwa selection content harus merepresentasikan work requirements yang relevan, bukan mereproduksi seluruh pekerjaan.
Core principle: Jangan bertanya, “Bagaimana membuat assignment ini semirip mungkin dengan pekerjaan?” Tanyakan, “Apa tugas terkecil yang masih cukup untuk menunjukkan competency penting yang ingin dinilai?” Pertanyaan kedua biasanya menghasilkan assessment yang lebih fokus dan lebih proporsional.
Jangan mulai dari case study yang terlihat menarik. Mulailah dari actual work dan tanyakan kepada hiring manager atau incumbent tugas mana yang paling penting untuk membedakan performance yang acceptable dengan yang kuat. Current SIOP recommendations juga menempatkan job analysis dan competency modeling sebagai dasar sebelum memilih atau mengembangkan selection procedure.
Untuk Customer Success, critical task dapat berupa diagnosis account risk, prioritization, dan communication. Untuk Software Engineer, critical task mungkin memahami existing code, menemukan bug, dan mempertimbangkan trade-off solusi. Contoh tersebut tetap perlu disesuaikan dengan pekerjaan nyata di perusahaan karena title yang sama dapat mempunyai tuntutan berbeda.
Label seperti “smart”, “high potential”, atau “strategic thinker” terlalu abstrak jika tidak diterjemahkan menjadi perilaku yang dapat diamati. Recruiter perlu menentukan apa yang sebenarnya harus muncul dalam output atau reasoning kandidat agar sebuah competency dapat dinilai. Dengan begitu, penilai tidak hanya memberikan score berdasarkan kesan umum.
Sebagai contoh, “strategic thinking” dapat dipecah menjadi beberapa evidence:
Daftar tersebut bukan universal rubric untuk semua role. Tujuannya adalah menunjukkan bagaimana construct yang abstrak diubah menjadi evidence yang lebih konkret. Actual behavioral criteria tetap harus berasal dari requirement pekerjaan.
Kandidat perlu memperoleh kesempatan yang cukup comparable untuk menunjukkan kemampuan. Samakan briefing, dataset, time allocation, tool policy, instructions, deliverable, dan bantuan yang diperbolehkan sejauh kondisi tersebut memang relevan terhadap construct. SIOP Principles menempatkan administration yang dapat dipertanggungjawabkan sebagai bagian penting dari penggunaan selection procedure.
Jika Candidate A mendapat 60 menit tanpa AI sementara Candidate B mendapat dua jam dan beberapa hints, score mereka tidak lagi straightforward untuk dibandingkan. Jika perusahaan menggunakan beberapa versi task untuk security, tingkat kesulitan dan evidence yang diminta perlu dibuat cukup setara. Standardization bukan berarti mengabaikan legitimate accommodations; kondisi dapat disesuaikan ketika diperlukan selama perusahaan memahami pengaruhnya terhadap interpretation score.
Untuk digital delivery, periksa juga accessibility dan technology constraints. ITC/ATP Technology-Based Assessment Guidelines menekankan bahwa delivery, accessibility, security, dan technology conditions dapat memengaruhi fairness serta valid interpretation. Recruiter perlu memastikan format task dapat diakses secara layak tanpa mengubah essential job standard yang sedang diukur.
Candidate brief harus menjelaskan apa yang perlu dikumpulkan, formatnya, batas scope, deadline, serta apakah reasoning atau supporting calculations perlu ditampilkan. Kandidat sebaiknya tidak dinilai berdasarkan kemampuannya menebak hidden expectation recruiter. Semakin ambigu deliverable, semakin sulit membedakan apakah perbedaan output berasal dari capability atau sekadar interpretasi terhadap brief.
Contoh instruction yang lebih jelas dapat berbunyi: “Berikan tiga prioritized recommendations, maksimal 600 kata, beserta assumptions dan supporting calculations.” Instruksi juga perlu menjelaskan apakah kandidat boleh meminta clarification atau menggunakan tools tertentu. Dengan demikian, evaluator menilai response terhadap task yang sama, bukan response terhadap interpretation yang berbeda-beda.
Tentukan apakah assessment dilakukan take-home atau live, berapa waktu yang tersedia, tools apa yang boleh digunakan, apakah collaboration diperbolehkan, dan bagaimana accommodation ditangani. Tidak ada scientific standard yang menunjukkan bahwa seluruh work sample harus berlangsung 45, 60, atau 90 menit. Studi Speer, King, dan Grossenbacher juga menunjukkan bahwa hubungan antara panjang assessment dan applicant reactions tidak sesederhana “semakin lama pasti semakin buruk”, meskipun studi tersebut bukan penelitian khusus work sample.
Karena itu, pilih durasi berdasarkan seberapa banyak evidence yang benar-benar diperlukan dibanding effort yang diminta dari kandidat. Monitor invitation-to-start, completion, abandonment, actual completion time, assessor time, dan candidate feedback setelah assessment digunakan. Review 2026 oleh Gilliland dan Steiner menunjukkan applicants secara umum bereaksi cukup positif terhadap work sample, tetapi temuan itu bukan alasan untuk memberikan assignment yang berlebihan.
Scoring criteria sebaiknya ditentukan sebelum submissions masuk. Jika rubric baru dibuat setelah beberapa kandidat dilihat, standard dapat bergeser mengikuti response yang kebetulan muncul lebih dahulu. Predefined criteria membantu memisahkan “apa yang seharusnya dinilai” dari “siapa yang kebetulan terlihat impresif”.
Tentukan dimensions, behavioral anchors, dan critical errors jika memang berkaitan langsung dengan minimum requirement pekerjaan. Weighting dapat digunakan jika ada alasan yang jelas, tetapi jangan mengasumsikan setiap dimension perlu mempunyai bobot angka. Yang paling penting adalah recruiter memahami evidence apa yang membuat sebuah response mendapat penilaian lebih tinggi atau lebih rendah.
Sebelum digunakan dalam volume besar, uji task dan rubric menggunakan sample responses, synthetic answers, atau contoh dari orang yang memahami pekerjaan. Minta evaluator memberi score secara independen sebelum mereka mendiskusikan hasil. Langkah ini membantu menemukan instruction yang ambigu, task yang terlalu mudah atau terlalu sulit, serta bagian rubric yang ditafsirkan berbeda.
Jika competent raters memberi score yang jauh berbeda untuk response yang sama, jangan langsung menganggap salah satu evaluator “lebih benar”. Periksa dimension mana yang menimbulkan disagreement, diskusikan observable evidence yang seharusnya membedakan level score, lalu revisi anchor bila diperlukan. Setelah itu, lakukan calibration kembali sebelum assessment digunakan lebih luas.
Rubric seperti “Overall quality: 1–5” memberi terlalu banyak ruang untuk interpretation. Evaluator dapat mempunyai definisi berbeda tentang “bagus”, sehingga candidate output yang sama dapat mendapat score berbeda berdasarkan siapa yang menilai. Rubric yang lebih kuat memecah performance menjadi dimensions yang observable dan relevan terhadap pekerjaan.
Untuk B2B Sales Discovery, misalnya, rubric dapat menilai beberapa area berikut:
Dimensions tersebut hanya contoh, bukan universal sales rubric. Bobot seperti 30%, 25%, atau 20% juga tidak perlu digunakan jika tidak ada rationale yang jelas dari job requirements. Lebih banyak dimensions atau formula yang terlihat kompleks tidak otomatis menghasilkan assessment yang lebih baik.
Hal yang lebih penting adalah behavioral anchors. Penelitian Langhan dan Tiyyagura (2022) menemukan bahwa penggunaan behaviorally anchored domains mengubah scoring patterns dan meningkatkan jumlah domain dengan inter-rater reliability yang baik dalam konteks fellowship selection. Studi tersebut tidak membuktikan bahwa BARS otomatis membuat seluruh work sample reliable, tetapi mendukung penggunaan perilaku konkret dibanding label generik seperti “poor”, “average”, dan “excellent”.
Untuk dimension “diagnosis”, anchor dapat dibuat seperti berikut:
Anchor seperti itu membuat evaluator mempunyai referensi yang lebih konkret ketika memberi score. Evidence dari performance assessment lain juga menunjukkan bahwa concrete exemplars dapat membantu consistency antar-rater, seperti studi Patnaik, Anton, dan Stefanidis, walaupun konteks penelitian tersebut adalah surgical performance dan bukan recruitment work sample. Karena itu, actual consistency tetap perlu diukur pada assessment yang digunakan perusahaan sendiri.
Menggunakan lebih dari satu independent rater dapat membantu perusahaan melihat apakah rubric ditafsirkan secara serupa oleh evaluator yang berbeda. Namun penambahan rater juga meningkatkan review time dan operational cost, sehingga tidak semua submission harus otomatis dinilai oleh banyak orang. Pendekatan yang proporsional dapat menggunakan multiple raters pada calibration samples, high-stakes decisions, atau borderline responses ketika disagreement berpotensi mengubah keputusan.
Single-rater workflow tetap membutuhkan quality control. Recruiter dapat melakukan periodic double-scoring pada sample submissions untuk melihat apakah scoring drift mulai muncul, lalu melakukan recalibration jika diperlukan. Pilihan jumlah rater perlu mempertimbangkan konsekuensi keputusan, workload, serta reliability yang benar-benar dibutuhkan.
Tidak ada evidence yang mendukung IRR ≥ 0.70 sebagai universal “pass” untuk seluruh work sample. SIOP Principles menekankan pentingnya reliability, sementara applied studies menggunakan metrics dan konteks yang berbeda sehingga satu angka tidak dapat dipindahkan begitu saja ke semua assessment. High agreement juga tidak otomatis berarti task valid untuk memprediksi atau menilai performance yang dimaksud.
Yang lebih berguna adalah mengidentifikasi metric yang digunakan, mengukur disagreement, melihat dimensions yang bermasalah, dan melakukan calibration ulang. Jika disagreement tetap besar, perbaiki wording atau behavioral anchors sebelum menganggap problem selesai. Reliability dan validity adalah pertanyaan yang berbeda dan keduanya perlu dievaluasi.
Tidak ada satu format yang selalu paling baik. Take-home dapat memberikan flexibility dan lebih menyerupai asynchronous work pada beberapa role, sedangkan live assessment membuat reasoning, interaction, dan ownership lebih mudah diamati. ITC/ATP Technology-Based Assessment Guidelines juga mendukung pemilihan digital assessment berdasarkan construct, administration, security, dan fairness, bukan asumsi bahwa satu mode selalu superior.
Secara praktis:
Jangan menetapkan durasi seperti “60–90 menit take-home + 20 menit walkthrough” sebagai formula baku hanya karena terlihat rapi. Scope harus mengikuti complexity task dan information need. Format yang baik adalah format yang memungkinkan candidate behavior relevan muncul tanpa menambah beban yang tidak diperlukan.
Pertanyaan “Apakah kandidat memakai ChatGPT?” semakin kurang berguna jika berdiri sendiri. Pertanyaan yang lebih penting adalah capability apa yang sebenarnya dapat disimpulkan dari output tersebut. Lievens dan Dunlop (2025) menjelaskan bahwa penggunaan GenAI dapat memengaruhi selection assessment dengan cara berbeda tergantung apa yang ingin diukur dan apakah penggunaan AI menyerupai actual work.
Jika employee nantinya menggunakan AI untuk coding, analysis, writing, atau research, melarang AI sepenuhnya dapat membuat assessment kurang mencerminkan kondisi pekerjaan. Sebaliknya, jika perusahaan harus memastikan baseline skill tanpa bantuan, unaided stage masih dapat relevan. Policy perlu mengikuti construct yang ingin diukur, bukan satu aturan universal untuk seluruh role.
Tiga pendekatan yang dapat dipertimbangkan adalah:
Apa pun pendekatannya, jelaskan policy sejak awal. Jangan membuat kandidat menebak apakah ChatGPT, Copilot, search, atau calculator diperbolehkan. Transparansi membuat kondisi assessment lebih comparable dan membantu recruiter memahami arti output yang diterima.
Submitted output tidak selalu membuktikan siapa yang mengerjakan setiap bagian atau seberapa jauh kandidat memahami reasoning di baliknya. Karena itu, verification dapat meminta kandidat menjelaskan assumptions, mempertahankan trade-offs, mengkritik response sendiri, atau mengubah solution ketika scenario berubah. Pendekatan ini lebih informatif daripada hanya mengandalkan AI-output detector.
Untuk coding work sample, misalnya, recruiter dapat mengatakan bahwa data sekarang mempunyai duplicated customer IDs dan meminta kandidat menjelaskan perubahan yang diperlukan pada solution-nya. Kandidat perlu menunjukkan apakah ia memahami logic yang digunakan, bukan sekadar mengulang final output. Verification tetap bukan bukti absolut bahwa semua pekerjaan sebelumnya dibuat tanpa bantuan, tetapi memberi evidence tambahan tentang ownership dan understanding.
Security risk juga lebih luas daripada AI. International Test Commission memperlakukan test security sebagai bagian tersendiri dari assessment governance, termasuk administration dan perlindungan integrity assessment. Recruiter dapat menggunakan scenario variation, candidate-specific follow-up, dan identity controls yang proporsional terhadap stakes tanpa mengarang prevalence statistic mengenai “joki” atau proxy completion di Indonesia.
Work sample seharusnya dirancang untuk assessment, bukan untuk memperoleh commercially useful work secara gratis. The Management Center merekomendasikan fictional atau past exercises dan membedakan candidate assessment dari pekerjaan substansial yang memberi direct organizational benefit. Guidance tersebut merupakan practitioner guidance, bukan pernyataan hukum Indonesia.
Contoh yang lebih aman antara lain:
Jika assignment sangat luas atau menghasilkan real commercial value, perusahaan dapat mempertimbangkan scope yang lebih kecil, compensation, dan terms yang jelas mengenai penggunaan hasil serta intellectual property. Evidence yang tersedia tidak menetapkan aturan universal Indonesia seperti “assignment di atas X jam wajib dibayar”. Untuk keputusan mengenai kewajiban pembayaran, ownership, atau IP pada kasus tertentu, perusahaan sebaiknya berkonsultasi dengan legal atau compliance counsel yang relevan.
Work sample sering dipandang cukup positif karena kandidat mendapatkan kesempatan untuk menunjukkan kemampuan secara langsung. Review 2026 oleh Gilliland dan Steiner melaporkan applicant reactions yang relatif favorable terhadap work-sample tests dan interviews dibanding banyak metode selection lain. Namun average reaction yang positif tidak berarti setiap assignment otomatis terasa fair atau proporsional.
Setelah go-live, monitor invitation-to-start rate, completion, abandonment, actual completion time, dan candidate feedback. Tanyakan apakah instructions jelas, task terasa relevan terhadap role, teknologi menghambat pengerjaan, atau scope terasa tidak proporsional. Data tersebut membantu recruiter memperbaiki design tanpa mengasumsikan candidate experience hanya dari pendapat internal hiring team.
Perceived fairness juga tidak dapat langsung digeneralisasi lintas konteks. Studi 2024 oleh Aouam dan Belmouffeq menemukan work samples termasuk metode yang dinilai relatif favorable oleh job seekers dalam sample Maroko. Temuan itu berguna sebagai evidence non-Western, tetapi tidak sama dengan validation pada candidate population Indonesia.
Tidak ada rule bahwa work sample harus selalu ditempatkan di middle funnel. Placement perlu mempertimbangkan candidate effort, applicant volume, assessor cost, dan information value. Tugas singkat dapat masuk lebih awal jika competency yang diuji memang essential dan assessment-nya proporsional, sedangkan simulation yang lebih berat biasanya lebih masuk akal ketika candidate pool sudah lebih kecil.
Short micro-task yang hanya membutuhkan beberapa menit mungkin dapat digunakan pada high-volume recruitment. Deeper work sample lebih cocok setelah basic screening jika membutuhkan substantive candidate effort atau assessor review. Senior simulation yang kompleks biasanya perlu alasan yang lebih kuat karena cost bagi kandidat dan perusahaan juga lebih tinggi.
Jika recruiter belum yakin kapan work sample cocok dibanding jenis assessment lain, panduan Pre-Employment Assessment membahas arsitektur selection yang lebih luas. Untuk assessment yang fokus pada cognitive reasoning, lihat juga Aptitude Test Recruitment. Work sample sendiri sebaiknya dipilih ketika direct demonstration terhadap job-relevant behavior benar-benar menambah evidence.
Sebelum assessment dijalankan, tentukan fungsi score dalam keputusan. SIOP Principles menekankan bahwa interpretation dan use dari selection procedure perlu didukung oleh evidence yang sesuai dengan intended inference. Work sample score bukan ukuran universal “candidate quality”.
Fungsi score dapat dibedakan seperti berikut:
Jangan membuat formula seperti “Work sample 80 + personality 60 = candidate quality 70” tanpa evidence bahwa construct dan score tersebut memang dapat digabung dengan cara itu. Sackett et al. (2023) mendukung penggunaan kombinasi job-relevant predictors dalam selection system, tetapi tidak memberikan satu universal weighting formula. Jika dua methods menghasilkan evidence yang berbeda, recruiter perlu memahami mengapa hasilnya berbeda sebelum sekadar merata-ratakan score.
Jika work sample score kemudian berhubungan dengan probation rating atau outcome lain, interpretasinya juga perlu hati-hati. Association antara assessment score dan later performance dapat menjadi validation evidence, tetapi tidak membuktikan bahwa assessment menyebabkan performance tersebut. Post-launch monitoring sebaiknya digunakan untuk mengevaluasi selection procedure, bukan menciptakan causal claim yang tidak didukung data.
Sebelum work sample test digunakan, pastikan desain, scoring, candidate experience, dan decision role sudah cukup jelas. Checklist ini membantu recruitment team menemukan masalah sebelum assessment diberikan dalam volume besar. Tidak semua item memerlukan sistem yang kompleks, tetapi semuanya perlu mempunyai jawaban yang dapat dipertanggungjawabkan.
Task design
Administration
Scoring
Verification
Candidate experience
Decision use
Mimo relevan terutama sebagai contoh orchestration dan verification workflow, bukan sebagai bukti validity work sample tertentu. Secara publik, Mimo menghubungkan candidate screening, assessment, dan interview/recruiter review dalam satu recruitment workflow. Validity task, quality rubric, rater consistency, fairness, dan cutoff tetap memerlukan assessment-specific evidence.
Skill test adalah kategori yang lebih luas dan dapat mengisolasi satu kemampuan, misalnya SQL syntax. Work sample menempatkan satu atau beberapa kemampuan dalam konteks pekerjaan yang lebih terintegrasi, misalnya menggunakan SQL untuk menganalisis data dan membuat recommendation. Karena itu, work sample biasanya memberi job-like evidence yang lebih kontekstual, tetapi tetap bukan simulasi sempurna terhadap seluruh pekerjaan.
Tidak ada satu universal ideal duration untuk seluruh work sample. Gunakan task terpendek yang masih menghasilkan evidence yang cukup dan monitor actual completion time serta candidate feedback setelah assessment digunakan. Durasi perlu mengikuti complexity task dan information value, bukan angka standar yang dipakai untuk semua role.
Bisa, jika task tersebut relevan dengan pekerjaan, administration dan deliverable-nya jelas, serta mempunyai scoring rubric yang ditentukan sebelumnya. Take-home yang hanya berupa random homework tanpa hubungan kuat dengan pekerjaan atau standard scoring belum tentu merupakan rigorous work sample. Format pengerjaan tidak menggantikan kebutuhan akan task design dan evaluation yang defensible.
Tergantung capability yang ingin diukur. Jika AI merupakan bagian realistis dari pekerjaan, penggunaannya dapat diperbolehkan dan dinilai; jika unaided fundamentals memang penting, no-AI atau mixed stage dapat digunakan. Apa pun policy-nya, sampaikan sejak awal dan gunakan verification untuk memahami reasoning kandidat di balik output.
Work sample test yang baik tidak berusaha mensimulasikan seluruh pekerjaan atau mencari tugas yang paling sulit. Ia mengambil bagian pekerjaan yang cukup representatif, membuat kandidat menunjukkan behavior yang dapat diamati, lalu memberikan recruiter cara yang lebih konsisten untuk menilai evidence tersebut. Jika task terlalu besar, rubric terlalu vague, atau recruiter tidak tahu apa yang ingin dibuktikan, realism tambahan belum tentu membuat hiring decision menjadi lebih baik.
Sedang menyusun work sample test untuk candidate assessment? Mulailah dari critical task, tentukan behavior yang perlu diamati, pilih tugas yang proporsional, lalu buat rubric dan verification process sebelum assessment diberikan kepada kandidat. Dengan urutan tersebut, recruitment team mempunyai dasar yang lebih jelas untuk memahami apa yang sebenarnya dibuktikan oleh hasil tes.
Mimo dapat membantu menghubungkan CV screening, assessment, dan initial interview dalam recruitment workflow sehingga evidence dapat dikumpulkan secara bertahap. Namun task validity, scoring quality, candidate fairness, dan cara menggunakan score tetap perlu ditentukan berdasarkan assessment yang digunakan. Human judgment tetap diperlukan untuk menginterpretasikan seluruh evidence sebelum hiring decision dibuat.