A depressão é uma grave patologia psicossocial que produz alteração de humor, caracterizada por um forte sentimento de desesperança e tristeza profunda. Em estágios avançados, pode predispor os pacientes a pensamentos suicidas, destacando a importância de definir estratégias que proporcionem diagnósticos mais assertivos. Tradicionalmente, abordagens convencionais de diagnóstico baseiam-se em entrevistas semiestruturadas e questionários complementares. Ao agregar esses métodos a uma análise criteriosa de dados que incorpora características faciais, sinais de áudio e transcrições textuais, é possível obter indícios valiosos e rastrear a presença do transtorno. Posto isso, a presente tese introduz um modelo bimodal Ensemble Stacking Deep Neural Networks Multilevel aplicado ao reconhecimento da depressão em pacientes predispostos. A abordagem combina modelos base (DNNs_N1) juntamente a um metamodelo (DNN_N2), ambos os modelos baseados em arquiteturas de deep learning, capazes de processar informações audiovisuais e audiotextuais em diferentes níveis. A solução também aborda os desafios provenientes de múltiplas fontes, que incluem desbalanceamento de classes, alta variância e elevada dimensionalidade. Além disso, o estudo realizou uma extensa avaliação do método em datasets de referência, como o DAIC-WOZ, sua versão estendida, EDAIC, o MODMA e o D-Vlog. Ao todo, 11 metamodelos foram envolvidos na avaliação, incluindo arquiteturas como BiLSTM, Transformer, DCNN, TCN e classificadores ensemble como o RandomForest e o XGBoost. À medida que se incorporaram volumes expressivos de informações à análise, os resultados destacaram os metamodelos baseados em deep learning. Em especial, a arquitetura BiLSTM, que alcançou um grau de separabilidade, sensibilidade e especificidade satisfatório na avaliação de desempenho Cross-Datasets Validation, ao sobressair-se dos demais no tocante às métricas F1-score, AUC-ROC e AUC-PR. Para tornar mais clara a compreensão do processo decisório, mecanismos de explicabilidade foram empregados para interpretar as decisões do referido metamodelo. Adicionalmente, nos datasets multimodais D-Vlog (maior em quantidade de instâncias) e EDAIC obteve, respectivamente, 75,0% e 60,2% de Precisão; 82,9% e 70,6% de Recall; 78,7% e 64,8% de F1-score. Esses resultados atestam não apenas a eficácia da metodologia desenvolvida, mas também sua superioridade frente às abordagens reportadas na literatura, com significância estatística confirmada no dataset D-Vlog.