NCA-GENM Question 8
Select 3A team is training a multimodal generative AI model that integrates text and image data. They observe unstable training behavior, including oscillating loss values and mode collapse. Which strategies can be employed to control the stability of training in this multimodal setting?
- A
Use a balanced learning rate to ensure that both modalities contribute proportionally to the gradient updates.
- B
Apply modality-specific normalization techniques to handle differences in data distributions.
- C
Increase the batch size indefinitely to stabilize gradient calculations across modalities.
- D
Incorporate a curriculum learning approach where simpler tasks are introduced before complex multimodal tasks.
- E
Disable regularization techniques to prevent interference between modalities.
Show answer and explanation
Correct answers: A, B, D
Explanation
Training stability in multimodal settings is a critical challenge due to the differing characteristics of text and image data. Strategies such as balanced learning rates, modality-specific normalization, and curriculum learning directly address these challenges by mitigating gradient imbalances, handling data distribution differences, and managing task complexity. Conversely, overly simplistic or extreme measures such as arbitrarily increasing batch size or disabling regularization can exacerbate instability or lead to suboptimal training outcomes.
- A. Correct.
Using a balanced learning rate is critical in multimodal settings to prevent one modality from dominating the gradient updates, which can lead to instability.
- B. Correct.
Modality-specific normalization helps address the differences in data distributions between text and image modalities, improving training stability.
- C. Incorrect.
While increasing batch size can help smooth gradients to some extent, doing so indefinitely is impractical and can lead to issues such as memory constraints. It is not a recommended strategy for controlling multimodal training stability.
- D. Correct.
Curriculum learning gradually introduces the model to more complex tasks, helping stabilize training by reducing the likelihood of overwhelming the model early in the training process.
- E. Incorrect.
Disabling regularization techniques can lead to overfitting or instability, as regularization plays a key role in managing the interaction between modalities and preventing over-reliance on one modality.