Som vist i de foregående kapitler, kan modellens forudsigelser variere afhængigt af værdien af **k** (antallet af naboer). Når der opbygges en k-NN-model, er det vigtigt at vælge den k-værdi, der giver **bedst ydeevne**.

En almindelig tilgang er at anvende **krydsvalidering** til at evaluere modellens ydeevne. Det er muligt at køre et loop og beregne krydsvalideringsscore **for et interval af k-værdier**, og derefter vælge den med den højeste score. Dette er den mest udbredte metode.

Til dette formål tilbyder `sklearn` et praktisk værktøj: klassen `GridSearchCV`.


### Konstruktør:
* `GridSearchCV(estimator, param_grid, scoring, cv = 5)`
* `estimator` — modelobjektet;
* `param_grid` — ordbog med parameterværdier, der skal afprøves;
* `scoring` — metrikken, der anvendes til krydsvalideringsscore;
* `cv` — antal fold (5 som standard);

### Metoder:
* `fit(X, y)` — træner modellerne ved brug af X, y;
* `predict(X)` — forudsiger klassen for X;
* `score(X, y)` — returnerer nøjagtigheden for X, y sættet;

### Attributter:
* `best_estimator_` — objekt for modellen med højeste score;
* `best_score_` — scoren for `best_estimator_`.

Parameteren `param_grid` tager en **ordbog**, hvor nøglerne er parameternavne og værdierne er lister over muligheder, der skal afprøves. For eksempel, for at teste værdier fra `1` til `99` for `n_neighbors`, kan følgende skrives:
```python
param_grid = {'n_neighbors': range(1, 100)}
```
Ved at kalde `.fit(X, y)`-metoden på `GridSearchCV`-objektet vil parametergridet blive gennemgået for at finde de bedste parametre, hvorefter modellen **gen-trænes på hele datasættet** med disse bedste parametre.

Det er muligt at tilgå **bedste score** ved hjælp af attributten `.best_score_` og foretage forudsigelser med den optimerede model ved brug af `.predict()`-metoden. Ligeledes kan **bedste model** selv hentes via attributten `.best_estimator_`.

import unittest
import importlib


def _dynamic_test(test_case, condition, success_message, failure_message):
    if condition:
        test_case._testMethodName = success_message
        test_case.assertTrue(True, success_message)
    else:
        test_case._testMethodName = failure_message
        test_case.fail(failure_message)


class TestUserCode(unittest.TestCase):

    def test_param_grid_is_declared(self):
        import user_code

        variable = 'param_grid'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_para_grid_is_dict(self):
        import user_code

        try:
            condition = isinstance(user_code.param_grid, dict)
            failure_message = f"Expected `param_grid` to be a `dict`, but got `{type(user_code.param_grid).__name__}`."
        except AttributeError:
            condition = False
            failure_message = "The `param_grid` variable is not declared."

        _dynamic_test(
            self,
            condition,
            "`param_grid` is a `dict`.",
            failure_message
        )

    def test_param_grid_is_correct(self):
        import user_code
        expected_value = {'n_neighbors': [3, 9, 18, 27]}

        variable = 'param_grid'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, dict):
            condition = actual_value == expected_value
            failure_message = f"Expected `{variable}` to contain `{expected_value}`, but got `{actual_value}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `dict`."

        _dynamic_test(
            self,
            condition,
            f"`{variable}` contains the correct values.",
            failure_message
        )

    def test_grid_search_is_declared(self):
        import user_code

        variable = 'grid_search'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_grid_search_is_correct(self):
        import user_code
        from sklearn.model_selection import GridSearchCV
        from sklearn.neighbors import KNeighborsClassifier

        knn = KNeighborsClassifier()
        param_grid = {'n_neighbors': [3, 9, 18, 27]}

        variable = 'grid_search'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, GridSearchCV):
            condition = isinstance(actual_value.estimator, KNeighborsClassifier) and actual_value.param_grid == param_grid and actual_value.cv == 4
            failure_message = f"Expected `{variable}` to be a `GridSearchCV` with `knn` as the model, `4` folds, and `param_grid` as the grid of parameters, but got `estimator={actual_value.estimator}`, `param_grid={actual_value.param_grid}`, and `cv={actual_value.cv}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `GridSearchCV`."

        _dynamic_test(
            self,
            condition,
            "`grid_search` is a `GridSearchCV` with `estimator=knn`, `param_grid=param_grid`, and `cv=4`.",
            failure_message
        )

    def test_best_model_is_declared(self):
        import user_code

        variable = 'best_model'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_best_model_is_correct(self):
        import user_code
        from sklearn.neighbors import KNeighborsClassifier

        variable = 'best_model'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, KNeighborsClassifier):
            condition = actual_value.n_neighbors == 27
            failure_message = f"Expected `{variable}` to be a `KNeighborsClassifier` with `27` neighbors, but got `n_neighbors={actual_value.n_neighbors}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `KNeighborsClassifier`."

        _dynamic_test(
            self,
            condition,
            "`best_model` is a `KNeighborsClassifier` with `27` neighbors.",
            failure_message
        )

    def test_best_score_is_declared(self):
        import user_code

        variable = 'best_score'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_best_score_is_correct(self):
        import user_code
        expected_value = 0.8039505464098539

        variable = 'best_score'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, float):
            condition = actual_value == expected_value
            failure_message = f"Expected `{variable}` to contain `{expected_value}`, but got `{actual_value}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `float`."

        _dynamic_test(
            self,
            condition,
            f"`{variable}` is correct.",
            failure_message
        )


if __name__ == '__main__':
    unittest.main()

test_main.py

Behersk de centrale algoritmer inden for supervised learning og implementer dem ved hjælp af Scikit-learn. Udforsk lineær og polynomiel regression til prisforudsigelse, og gå videre til klassifikation ved hjælp af k-NN, logistisk regression og beslutningstræer. Lær at evaluere modeller gennem krydsvalidering, håndtere overfitting med regularisering og optimere hyperparametre. Byg robuste prædiktive systemer og definer komplekse beslutningsgrænser for multi-klasse klassifikationsopgaver.

Udfordring: Valg af den Bedste K-værdi

Konstruktør:

Metoder:

Attributter:

Løsning