$\textbf{A) Benjamini-Hochberg procedure}$
1.
$z = {\bf X}^TY,$
$\quad ={\bf X}^T{\bf X}\beta^* + {\bf X}^T\epsilon,$
$\quad =\beta^* + {\bf X}^T\epsilon.$
Donc:
(1)2. Pour reprendre les notations du cours:
(2)La collection de probabilités est donc:
(3)Avec:
(4)Donc, pour tout $j \in \{1, \cdots ,p \}$:
(5)Donc ici, avec $\sigma = 1$, $\Theta_{0,j}= \{0\}$ et $\widehat{S_j} := \vert z_j\vert$:
$\widehat{p_j} = \mathbb{P}_{\theta}(\vert N\vert > \vert z_j\vert ),$
$\quad = \tau(\vert z_j\vert ).$
3. Avec les notations du cours, la procédure de B-H de niveau $\alpha$ s'écrit:
$R = \{j, \widehat{p_j} \leq \frac{\alpha \hat{k}}{p} \}$
$\hat{k} = \max \{k, \widehat{p_{(k)}} \leq \frac{\alpha k}{p}\}$
On définit:
$\widehat{j_{HB}} := \max \{j, \tau(\vert z\vert_{[j]} ) \leq \frac{\alpha j}{p}\}$
Comme les $\vert z\vert_{[j]}$ sont classés décroissants et que $\tau$ est strictement décroissante, les $\tau(\vert z\vert_{[j]})$ sont classés croissants. Ce sont donc les $\widehat{p_{(j)}}$ de la définition et $\hat{k} = \widehat{j_{HB}}$.
De plus, par définition de $\widehat{R}$, on rejette $\mathcal{H}_{0,j}$ si:
$\widehat{p_j} \leq \widehat{p_{(\widehat{j_{HB}})}} \leq \frac{\alpha \widehat{j_{HB}}}{p}$.
Donc on rejette si:
$\tau(\vert z_j \vert) \leq \tau(\vert z\vert_{[\widehat{j_{HB}}]}).$
Et par décroissance de $\tau^{-1}$, on rejette si:
$\vert z_j \vert \geq \vert z\vert_{[\widehat{j_{HB}}]}.$
$\textbf{B) Link between the 2 procedures}$
1.
$2(\mathcal{L}(\beta) - \sum_{j=1}^p \lambda_j \vert\beta\vert_{[j]}) = \Vert Y-{\bf X}z + {\bf X}(z-\beta) \Vert^2,$
$\quad = \Vert Y-{\bf X}z \Vert^2 + \Vert {\bf X}(z-\beta) \Vert^2, \qquad$ Pythagore
$\quad = \Vert Y-{\bf X}z \Vert^2 + (z-\beta)^T{\bf X}^T{\bf X}(z-\beta) , \qquad$
$\quad = \Vert Y-{\bf X}z \Vert^2 + \Vert (z-\beta) \Vert^2 .$
2.
$\mathcal{L}(\beta) - \mathcal{L}(\tilde{\beta}) = \frac{1}{2} \left(\Vert (z-\beta) \Vert^2 -\Vert (z-\tilde{\beta}) \Vert^2 \right) + \sum_{j=1}^p \lambda_j \left(\vert\beta\vert_{[j]} - \vert\tilde{\beta}\vert_{[j]} \right)$
Le second terme de droite est nul car en réindexant on perd l'effet de la permutation.
Pour le premier terme de droite on a:
$\Vert (z-\beta) \Vert^2 -\Vert (z-\tilde{\beta}) \Vert^2 = \sum_{k=1}^p \left((z_k -\beta_k)^2 -(z_k-\tilde{\beta}_k)^2 \right)$
$\quad = (z_i - \beta_i)^2 + (z_j-\beta_j)^2 - (z_i-\tilde{\beta}_i)^2 + (z_j-\tilde{\beta}_j)^2$
$\quad = 2(\beta_j-\beta_i)(z_i-z_j) >0$
3. D'après le résultat précédent, si l'on peut trouver deux coordonnées vérifiant $i<j, \beta_i<\beta_j$ alors on peut construire un meilleur estimateur simplement en permutant les deux indices. L'estimateur $\hat{\beta}$ doit donc être ordonné décroissant.
De plus, si l'on considère $\hat{\beta}$ un estimateur positif et $\beta$ vérifiant:
$\beta_1 \geq \cdots \geq \beta_k \geq 0 \geq \beta_{k+1} \geq \cdots \geq \beta_p$
Avec pour tout $j>k$:
$\beta_j = -\hat{\beta_j}$
Alors:
$\sum_{j=1}^p \lambda_j \vert\beta\vert_{[j]} = \sum_{j=1}^p \lambda_j \vert\hat{\beta}\vert_{[j]}$
Mais, pour tout $j>k$:
$(z_j-\beta_j)^2 - (z_j-\hat{\beta}_j)^2 = -4z_j\beta_j \leq 0$
Donc:
$\mathcal{L}(\beta) \geq \mathcal{L}(\hat{\beta})$
Les coefficients de $\hat{\beta}$ doivent donc tous être positifs (non négatifs) pour minimiser $\mathcal{L}$
4. Par définition de $\widehat{j_{HB}}$, pour tout $j>\widehat{j_{HB}}$:
$\tau(\vert z_j\vert) >\frac{\alpha j}{p}$
Et donc:
$\vert z_j\vert < \tau^{-1}(\frac{\alpha j}{p})$
Ainsi:
$\mathcal{L}(\tilde{\beta'}) - \mathcal{L}(\tilde{\beta}) = \frac{1}{2}\left(\Vert z-\tilde{\beta'} \Vert^2 \Vert z-\tilde{\beta'} \Vert^2 \right) - \sum_{j = j_{HB}+1}^p \lambda_j \hat{\beta_j}$
$\quad = \frac{-1}{2}\sum_{j = j_{HB}+1}^p \left ((z_j -\hat{\beta_j})^2 + 2\lambda_j \hat{\beta_j} -z_j^2\right)$
$\quad = \frac{-1}{2}\sum_{j = j_{HB}+1}^p \left (\hat{\beta_j}^2 + 2\hat{\beta_j}(\lambda_j -z_j)\right) \leq 0$
Avec égalité si $\hat{\beta_j}=0$.





