Data preprocessing and feature engineering: Practice Questions — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)

Practice Questions: Data Preprocessing and Feature Engineering This set of multiple-choice questions is designed to help candidates prepare for the...

Practice Questions: Data Preprocessing and Feature Engineering

This set of multiple-choice questions is designed to help candidates prepare for the Data Analysis and Visualization section of the NVIDIA-Certified Associate: Generative AI LLM exam, focusing specifically on data preprocessing and feature engineering.

  1. Which of the following is the primary purpose of data preprocessing in machine learning workflows?

    • A. To increase the size of the dataset by duplicating samples
    • B. To clean and transform raw data into a suitable format for modeling
    • C. To train the model directly on raw data without modification
    • D. To reduce the number of features by random elimination

    Correct answer: B

    Explanation: Data preprocessing involves cleaning and transforming raw data (e.g., handling missing values, normalization) to prepare it for effective model training.

  2. Which technique is commonly used to handle missing numerical data during preprocessing?

    • A. One-hot encoding
    • B. Mean or median imputation
    • C. Principal Component Analysis (PCA)
    • D. Tokenization

    Correct answer: B

    Explanation: Mean or median imputation replaces missing numerical values with the average or median, preserving dataset integrity for modeling.

  3. What is the main goal of feature engineering in the context of large language models (LLMs)?

    • A. To reduce the dataset size by removing samples
    • B. To create or transform input features that improve model performance
    • C. To increase the number of model parameters
    • D. To convert text data into images

    Correct answer: B

    Explanation: Feature engineering involves creating or transforming features (e.g., tokenization, embeddings) to better represent data for the model.

  4. Which GPU-accelerated library is commonly used for efficient data manipulation and preprocessing in AI workflows?

    • A. Pandas
    • B. NumPy
    • C. cuDF
    • D. Matplotlib

    Correct answer: C

    Explanation: cuDF is a GPU-accelerated dataframe library that speeds up data manipulation and preprocessing tasks compared to CPU-based libraries.

  5. Why is normalization important during data preprocessing?

    • A. It increases the dimensionality of the data
    • B. It scales features to a standard range to improve model convergence
    • C. It removes irrelevant features
    • D. It converts categorical data into numerical data

    Correct answer: B

    Explanation: Normalization scales features to a consistent range (e.g., 0 to 1), which helps models converge faster and perform better.

  6. Which feature engineering method is suitable for converting categorical text data into a numerical format?

    • A. Tokenization
    • B. One-hot encoding
    • C. Imputation
    • D. Data augmentation

    Correct answer: B

    Explanation: One-hot encoding transforms categorical variables into binary vectors, enabling models to process categorical data numerically.

  7. During preprocessing, what is the purpose of tokenization in natural language processing (NLP)?

    • A. To split text into smaller units such as words or subwords
    • B. To remove stop words from the dataset
    • C. To convert numerical data into categorical labels
    • D. To visualize data distributions

    Correct answer: A

    Explanation: Tokenization breaks down text into tokens (words, subwords) which are the basic units for LLM input processing.

More in this topic

Preparing datasets for machine learning: Worked Example — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data analysis and visualization: Quick Reference — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)GPU-accelerated data manipulation: Worked Example — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)GPU-accelerated data manipulation — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data analysis and visualization: Worked Example — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data analysis and visualization — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Preparing datasets for machine learning — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data preprocessing and feature engineering: Common Mistakes — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)GPU-accelerated data manipulation: Practice Questions — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Preparing datasets for machine learning: Quick Reference — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Preparing datasets for machine learning: Practice Questions — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)GPU-accelerated data manipulation: Quick Reference — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data analysis and visualization: Common Mistakes — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Preparing datasets for machine learning: Common Mistakes — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data Analysis and Visualization — NVIDIA-Certified Associate: Generative AI LLMData preprocessing and feature engineering: Worked Example — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data preprocessing and feature engineering — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)GPU-accelerated data manipulation: Common Mistakes — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data preprocessing and feature engineering: Quick Reference — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)Data analysis and visualization: Practice Questions — Data Analysis and Visualization (NVIDIA-Certified Associate: Generative AI LLM)

Related topics:

#NVIDIA #generativeAI #data-preprocessing #feature-engineering #AI-certification

Ready to test your knowledge?

Put what you've learned into practice with a quick quiz and track your progress.

Test your knowledge →