Sobre a Simulação de Dados
Esta ferramenta gera dados sintéticos de experimentos multi-ambiente usando um modelo linear aditivo. Os parâmetros reais (efeitos genéticos, ambientais e de interação) são conhecidos — isso permite validar se os métodos estatísticos nas abas seguintes recuperam corretamente esses valores.
Modelo de geração dos dados
$$y_{ijk} = \mu + G_i + E_j + GE_{ij} + e_{ijk}$$ onde:
- \(y_{ijk}\) — produtividade observada do genótipo \(i\) no ambiente \(j\), repetição \(k\)
- \(\mu\) — média geral do experimento
- \(G_i \sim N(0, \sigma^2_g)\) — efeito aleatório do genótipo \(i\)
- \(E_j \sim N(0, \sigma^2_a)\) — efeito aleatório do ambiente \(j\)
- \(GE_{ij} \sim N(0, \sigma^2_{ge})\) — efeito aleatório da interação genótipo × ambiente
- \(e_{ijk} \sim N(0, \sigma^2_e)\) — erro residual (ruído experimental)
Herdabilidade
A herdabilidade (\(H^2\)) indica a proporção da variação fenotípica atribuível a diferenças genéticas. Valores próximos de 1 indicam que o ambiente influencia pouco — os genótipos ranqueiam de forma consistente. Valores próximos de 0 indicam que o ambiente domina — o ranking varia muito.
$$H^2 = \frac{\sigma^2_g}{\sigma^2_g + \frac{\sigma^2_{ge}}{n_a} + \frac{\sigma^2_e}{n_a \cdot n_r}}$$ \(n_a\) = número de ambientes, \(n_r\) = número de repetições
Referência: Holland, J. B., Nyquist, W. E., & Cervantes-Martínez, C. T. (2003). Estimating and interpreting heritability for plant breeding: An update. Plant Breeding Reviews, 22, 9-112.
Herdabilidade simulada (H²)
Total de observações
Genótipos × Ambientes
Estrutura do Experimento
Componentes de Variação (Desvios Padrão, kg/ha)
Controle
Conexao com Banco de Dados
Carrega dados de experimentos de soja diretamente do PostgreSQL. Os dados precisam ter sido inseridos pelo ETL antes de usar esta aba.
Resumo dos Dados
Tabela de Dados
Distribuicao por Ambiente
Estatisticas Descritivas
Estrutura do Experimento (Genotipo x Ambiente)
Conectividade G×E
Diagnóstico da estrutura de presença da interação genótipo × ambiente: conectividade entre ambientes, componentes conexas, genótipos isolados/ponte e completude do delineamento. Funciona para dados simulados e reais.
A conectividade afeta a confiabilidade das estimativas de estabilidade — interprete esta aba antes de confiar nos BLUPs obtidos nas abas seguintes.
Gere dados na aba Simulação ou carregue dados reais na aba Banco de Dados antes de calcular.Diagnóstico de homocedasticidade das variâncias residuais (LRT)
Antes de estimar e comparar os efeitos genotípicos entre ambientes, é necessário verificar se a variância do erro experimental é homogênea entre os ambientes (homocedasticidade) ou se difere entre eles (heterocedasticidade). Quando alguns ambientes são muito mais variáveis que outros, tratá-los com uma única variância residual pode enviesar as estimativas e a comparação dos genótipos.
Para isso, esta aba ajusta dois modelos mistos que diferem apenas na estrutura da variância residual — um com variância residual única e outro com variância residual específica por ambiente — e os compara formalmente por meio do teste de razão de verossimilhança (LRT), indicando qual estrutura é mais adequada aos dados observados.
Procedimento
- Modelo homocedástico: variância residual única (σ²e), comum a todos os ambientes.
- Modelo heterocedástico: variância residual específica (σ²ej) estimada para cada ambiente.
- Veredito: se p < 0,05, há evidência de heterocedasticidade e seleciona-se o modelo heterocedástico; caso contrário, mantém-se o modelo homocedástico, mais parcimonioso.
Este teste avalia apenas a homogeneidade da variância residual — não substitui a modelagem estrutural da interação genótipo × ambiente.
Gere os dados na aba Simulação antes de executar.Sobre o Modelo Misto (REML/BLUP)
O modelo linear misto é a abordagem padrão para a análise de experimentos multi-ambiente com dados incompletos. Diferentemente da ANOVA clássica, ele não exige que todos os genótipos estejam presentes em todos os ambientes.
O modelo em notação
$$y_{ijk} = \mu + G_i + E_j + GE_{ij} + e_{ijk}$$ em que cada termo representa uma fonte de variação do rendimento:
Fonte de variação e o que ela representa
- \(\sigma^2_g\) — efeito aleatório de genótipo: variabilidade entre os materiais genéticos avaliados. O BLUP de cada genótipo é sua predição.
- \(\sigma^2_a\) — efeito aleatório de ambiente: variabilidade entre os ambientes (diferenças de solo, clima e manejo).
- \(\sigma^2_{ge}\) — interação genótipo × ambiente: variabilidade do comportamento diferencial dos genótipos entre ambientes.
- \(\sigma^2_e\) — erro residual: variação não explicada pelo modelo (erro experimental).
Todos os efeitos são assumidos como aleatórios — cada componente de variância (\(\sigma^2_g\), \(\sigma^2_a\), \(\sigma^2_{ge}\), \(\sigma^2_e\)) é estimado via REML.
Estimação via REML (sommer)
Os componentes de variância são estimados via REML, utilizando o pacote sommer. O ajuste permite empregar estrutura de variância residual homogênea (única para todos os ambientes) ou heterogênea (específica por ambiente).
A estrutura de variância residual adotada é definida pelo teste de razão de verossimilhança (LRT) realizado na aba Diagnóstico: se não houver evidência de heterocedasticidade, mantém-se a variância residual única.
BLUP (Melhor Predição Linear Não-Viesada)
O BLUP é uma predição do valor genotípico — não é a média bruta observada. Ele aplica um encolhimento (shrinkage): genótipos com poucas observações são puxados em direção à média geral, refletindo a incerteza da estimativa. Quanto mais dados um genótipo possui, mais seu BLUP se aproxima da sua média observada.
Dados incompletos
Este modelo lida naturalmente com dados incompletos. O REML estima os componentes de variância maximizando a verossimilhança restrita a partir de toda a informação observada: cada combinação genótipo × ambiente presente contribui para a estimativa, e as combinações ausentes simplesmente não entram no cálculo — o método pondera cada observação pela informação que ela traz, sem exigir um banco completo ou balanceado. Por isso, a presença de lacunas não distorce as estimativas por si só.
A validade das estimativas, no entanto, depende mais da conectividade entre ambientes (verificada na aba Conectividade) do que da completude dos cruzamentos.
Controle
Sobre BLUPs e Estabilidade
O BLUP (Melhor Preditor Linear Não-Viesado) é a estimativa do valor genotípico de cada genótipo, obtida a partir do modelo misto ajustado na aba anterior. O BLUP não é a média bruta observada — ele incorpora um ajuste estatístico importante.
Shrinkage (contração)
Genótipos com poucas observações têm seus BLUPs puxados em direção à média geral. Isso reflete a incerteza: se temos poucos dados sobre um genótipo, a estimativa mais segura é que ele tem desempenho próximo da média, até que mais dados estejam disponíveis. O erro padrão (SE) na tabela indica essa incerteza — quanto menor o SE, mais confiável é a estimativa daquele genótipo.
Erro Padrão (SE)
$$SE_i = \sqrt{PEV_i}$$ onde \(PEV_i\) é a variância do erro de predição (prediction error variance) do BLUP do genótipo \(i\), extraída do modelo misto. Ela reflete a quantidade de observações do genótipo, a variância residual e a informação compartilhada entre ambientes (shrinkage).
Como interpretar
- Rank: ordenação por BLUP — o genótipo com maior BLUP é o de melhor desempenho predito.
- SE: erro padrão da estimativa. Genótipos com SE elevado têm estimativas menos precisas.
- Barras de erro: ± 2 × SE — intervalo aproximado do erro de predição do BLUP (não é um intervalo de confiança de 95% da predição).
Controle
Validação contra a Verdade Simulada
Esta aba é a única responsável por avaliar o quanto as estimativas do modelo misto se aproximam da verdade simulada. Ela compara os BLUPs, os componentes de variância e a herdabilidade estimados com os parâmetros reais usados na geração dos dados.
O que esta aba responde
- A ordem está certa? — ρ de Spearman entre os rankings (robusto ao shrinkage).
- A magnitude está certa? — r de Pearson entre efeito real e estimado.
- As variâncias e a herdabilidade foram recuperadas? — tabela de componentes vs verdade.
A validação só é possível com dados simulados (aba Simulação) — para dados reais (aba Banco de Dados) não existe verdade conhecida e a comparação fica indisponível.
Gere dados simulados e ajuste o modelo misto (aba Modelo Misto) antes de validar.