Zoals getoond in de vorige hoofdstukken, kunnen de voorspellingen van het model variëren afhankelijk van de waarde van **k** (het aantal buren). Bij het bouwen van een k-NN-model is het belangrijk om de k-waarde te kiezen die de **beste prestaties** oplevert.

Een gangbare aanpak is het gebruik van **cross-validatie** om de modelprestaties te evalueren. U kunt een lus uitvoeren en cross-validatiescores **voor een reeks k-waarden** berekenen, en vervolgens de waarde met de hoogste score selecteren. Dit is de meest gebruikte methode.

Om dit uit te voeren, biedt `sklearn` een handig hulpmiddel: de `GridSearchCV`-klasse.


### Constructor:
* `GridSearchCV(estimator, param_grid, scoring, cv = 5)`
* `estimator` — het modelobject;
* `param_grid` — woordenboek met parameterwaarden om te doorzoeken;
    * `scoring` — de metriek die wordt gebruikt voor de cross-validatiescore;
* `cv` — het aantal folds (standaard 5);

### Methoden:
* `fit(X, y)` — traint de modellen met X, y;
* `predict(X)` — voorspelt de klasse voor X;
* `score(X, y)` — retourneert de nauwkeurigheid voor de X, y-set;

### Attributen:
* `best_estimator_` — object van het model met de hoogste score;
* `best_score_` — de score van de `best_estimator_`.

De parameter `param_grid` neemt een **woordenboek** waarin de sleutels parameternamen zijn en de waarden lijsten met opties om te proberen. Om bijvoorbeeld waarden van `1` tot `99` voor `n_neighbors` te testen, kunt u het volgende schrijven:
```python
param_grid = {'n_neighbors': range(1, 100)}
```
Het aanroepen van de `.fit(X, y)`-methode op het `GridSearchCV`-object zal het parameterrooster doorzoeken om de beste parameters te vinden en vervolgens **het model opnieuw trainen op de volledige dataset** met deze beste parameters.

U kunt de **beste score** opvragen met het `.best_score_`-attribuut en voorspellingen doen met het geoptimaliseerde model via de `.predict()`-methode. Op dezelfde manier kunt u het **beste model** zelf ophalen met het `.best_estimator_`-attribuut.

import unittest
import importlib


def _dynamic_test(test_case, condition, success_message, failure_message):
    if condition:
        test_case._testMethodName = success_message
        test_case.assertTrue(True, success_message)
    else:
        test_case._testMethodName = failure_message
        test_case.fail(failure_message)


class TestUserCode(unittest.TestCase):

    def test_param_grid_is_declared(self):
        import user_code

        variable = 'param_grid'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_para_grid_is_dict(self):
        import user_code

        try:
            condition = isinstance(user_code.param_grid, dict)
            failure_message = f"Expected `param_grid` to be a `dict`, but got `{type(user_code.param_grid).__name__}`."
        except AttributeError:
            condition = False
            failure_message = "The `param_grid` variable is not declared."

        _dynamic_test(
            self,
            condition,
            "`param_grid` is a `dict`.",
            failure_message
        )

    def test_param_grid_is_correct(self):
        import user_code
        expected_value = {'n_neighbors': [3, 9, 18, 27]}

        variable = 'param_grid'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, dict):
            condition = actual_value == expected_value
            failure_message = f"Expected `{variable}` to contain `{expected_value}`, but got `{actual_value}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `dict`."

        _dynamic_test(
            self,
            condition,
            f"`{variable}` contains the correct values.",
            failure_message
        )

    def test_grid_search_is_declared(self):
        import user_code

        variable = 'grid_search'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_grid_search_is_correct(self):
        import user_code
        from sklearn.model_selection import GridSearchCV
        from sklearn.neighbors import KNeighborsClassifier

        knn = KNeighborsClassifier()
        param_grid = {'n_neighbors': [3, 9, 18, 27]}

        variable = 'grid_search'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, GridSearchCV):
            condition = isinstance(actual_value.estimator, KNeighborsClassifier) and actual_value.param_grid == param_grid and actual_value.cv == 4
            failure_message = f"Expected `{variable}` to be a `GridSearchCV` with `knn` as the model, `4` folds, and `param_grid` as the grid of parameters, but got `estimator={actual_value.estimator}`, `param_grid={actual_value.param_grid}`, and `cv={actual_value.cv}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `GridSearchCV`."

        _dynamic_test(
            self,
            condition,
            "`grid_search` is a `GridSearchCV` with `estimator=knn`, `param_grid=param_grid`, and `cv=4`.",
            failure_message
        )

    def test_best_model_is_declared(self):
        import user_code

        variable = 'best_model'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_best_model_is_correct(self):
        import user_code
        from sklearn.neighbors import KNeighborsClassifier

        variable = 'best_model'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, KNeighborsClassifier):
            condition = actual_value.n_neighbors == 27
            failure_message = f"Expected `{variable}` to be a `KNeighborsClassifier` with `27` neighbors, but got `n_neighbors={actual_value.n_neighbors}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `KNeighborsClassifier`."

        _dynamic_test(
            self,
            condition,
            "`best_model` is a `KNeighborsClassifier` with `27` neighbors.",
            failure_message
        )

    def test_best_score_is_declared(self):
        import user_code

        variable = 'best_score'
        _dynamic_test(
            self,
            hasattr(user_code, variable),
            f"The `{variable}` variable is declared.",
            f"Expected `{variable}` to be declared."
        )

    def test_best_score_is_correct(self):
        import user_code
        expected_value = 0.8039505464098539

        variable = 'best_score'
        actual_value = getattr(user_code, variable, None)
        if actual_value is None:
            condition = False
            failure_message = f"The `{variable}` variable is not declared."
        elif isinstance(actual_value, float):
            condition = actual_value == expected_value
            failure_message = f"Expected `{variable}` to contain `{expected_value}`, but got `{actual_value}`."
        else:
            condition = False
            failure_message = f"`{variable}` is not a `float`."

        _dynamic_test(
            self,
            condition,
            f"`{variable}` is correct.",
            failure_message
        )


if __name__ == '__main__':
    unittest.main()

test_main.py

Beheers de kernalgoritmen van supervised learning en implementeer deze met Scikit-learn. Verken lineaire en polynomiale regressie voor prijsvoorspelling en maak de overstap naar classificatie met k-NN, Logistische Regressie en Beslissingsbomen. Leer modellen evalueren via cross-validatie, overfitting beheersen met regularisatie en hyperparameters optimaliseren. Bouw robuuste voorspellende systemen en definieer complexe beslissingsgrenzen voor multi-klasse classificatietaken.

Uitdaging: Het Beste K-Waarde Kiezen

Constructor:

Methoden:

Attributen:

Oplossing