Data cleaning, quality handling, and governance: Practice Questions — Data Manipulation and Preparation (NVIDIA-Certified Associate: Accelerated Data Science)
Practice Questions: Data Cleaning, Quality Handling, and Governance These multiple-choice questions are designed to help you prepare for the Data...
Practice Questions: Data Cleaning, Quality Handling, and Governance
These multiple-choice questions are designed to help you prepare for the Data Manipulation and Preparation section of the NVIDIA-Certified Associate: Accelerated Data Science exam, focusing specifically on data cleaning, quality handling, and governance.
Which of the following is the most effective method to handle missing values in a large dataset processed with GPU acceleration?
- A. Drop all rows containing any missing values
- B. Use mean or median imputation leveraging cuDF or pandas
- C. Replace missing values with zero without analysis
- D. Ignore missing values during model training
Correct Answer: B
Explanation: Mean or median imputation is a common and effective method to handle missing data, especially when using GPU-accelerated libraries like cuDF or pandas. Dropping rows (A) can lead to data loss, replacing with zero (C) may introduce bias, and ignoring missing values (D) can degrade model performance.
In the context of data governance, which practice ensures traceability and accountability when cleaning data?
- A. Applying transformations without logging changes
- B. Maintaining data lineage and audit trails
- C. Using only automated scripts without documentation
- D. Allowing unrestricted data access for all users
Correct Answer: B
Explanation: Maintaining data lineage and audit trails is essential for data governance, enabling traceability and accountability. Logging changes helps track data cleaning steps. Options A, C, and D undermine governance principles.
Which GPU-accelerated library is best suited for scalable, distributed data cleaning tasks in a RAPIDS ecosystem?
- A. cuDF
- B. Dask
- C. pandas
- D. NumPy
Correct Answer: B
Explanation: Dask integrates with RAPIDS to provide scalable, distributed data processing and cleaning. cuDF (A) is for GPU DataFrames but less suited for distributed tasks. pandas (C) and NumPy (D) are CPU-based and less efficient for large-scale GPU-accelerated workflows.
What is the primary purpose of data validation rules during the data cleaning process?
- A. To generate synthetic data for training
- B. To detect and correct data inconsistencies and errors
- C. To reduce dimensionality of features
- D. To sample data for faster processing
Correct Answer: B
Explanation: Data validation rules help identify inconsistencies, missing values, and errors, ensuring data quality before analysis. Options A, C, and D relate to other data preparation tasks.
Which approach best addresses data quality issues caused by inconsistent categorical variable formats?
- A. Dropping categorical columns
- B. Standardizing categories using mapping functions in cuDF or pandas
- C. Converting all categories to numerical values without cleaning
- D. Ignoring categorical variables during feature engineering
Correct Answer: B
Explanation: Standardizing categorical variables by mapping inconsistent formats to a consistent set of categories is essential for quality data. Dropping or ignoring these variables (A, D) loses valuable information, and converting without cleaning (C) risks encoding errors.
In a governed data environment, which practice is critical to ensure compliance when cleaning sensitive data?
- A. Encrypting data at rest and in transit
- B. Sharing raw data freely among teams
- C. Using open datasets without restrictions
- D. Avoiding documentation of cleaning steps
Correct Answer: A
Explanation: Encrypting sensitive data protects privacy and ensures compliance with regulations. Sharing raw data freely (B) and avoiding documentation (D) violate governance principles. Using open datasets (C) is unrelated to sensitive data governance.
Which file format is recommended for efficient storage and processing of cleaned data in GPU-accelerated workflows?
- A. CSV
- B. JSON
- C. Parquet
- D. TXT
Correct Answer: C
Explanation: Parquet is a columnar storage format optimized for efficient processing and storage, widely used in GPU-accelerated data science pipelines. CSV and TXT are less efficient, and JSON is not optimized for large-scale numeric data.
What is the benefit of implementing automated data quality checks in a RAPIDS-powered ETL pipeline?
- A. It eliminates the need for data cleaning
- B. It ensures consistent detection of anomalies and errors during data ingestion
- C. It slows down the data processing significantly
- D. It replaces the need for data governance policies
Correct Answer: B
Explanation: Automated data quality checks help consistently detect anomalies and errors early in the ETL process, improving data reliability. They do not eliminate cleaning (A), nor replace governance (D), and when properly implemented, they do not significantly slow processing (C).
More in this topic
Ready to test your knowledge?
Put what you've learned into practice with a quick quiz and track your progress.
Test your knowledge →