Update – Problem gelöst!
Nach langem Debuggen hab ich die Lösung gefunden. Kurze Zusammenfassung was ich alles getestet habe und was am Ende geholfen hat:
Was ich getestet habe (was NICHT geholfen hat):
config.toml: ldconfig = "@/sbin/ldconfig" gesetzt → Container mit ldcache error gescheitert
config.toml: mode = "legacy" → Container startet gar nicht mehr
config.toml: ldconfig = "@/bin/true" → gleicher Fehler, /bin/true wird trotzdem mit Exit 1 gewertet
CDI-Spec generiert (nvidia-ctk cdi generate) und mode = "cdi" gesetzt → Container startet, aber libcuda wird nicht geladen
Was tatsächlich das Problem war:
Es sind zwei separate Probleme die zusammen aufgetreten sind:
Das bekannte ldcache/RAM-Filesystem Problem aus Issue #1385 – das verhindert den Container-Start wenn --runtime=nvidia fehlt oder legacy mode aktiv ist
Ein neuer Syscall den Treiber 595.71.05 braucht, der vom Docker Default-Seccomp-Profil geblockt wird → das ist der eigentliche Grund warum CUDA nicht funktioniert hat, auch wenn der Container gestartet ist
Fix:
Jeden GPU-Container braucht jetzt folgende Extra Parameters:
--runtime=nvidia (explizit setzen, --gpus=all alleine reicht nicht!)
--security-opt seccomp=unconfined
Nach dem Reboot läuft alles wieder – Tdarr transkodiert, Ollama greift auf die GPU zu.
Getestet auf:
Unraid 7.2.4
NVIDIA-Driver Plugin 2026.03.19
Treiber 595.71.05
Container Toolkit v1.19.0
RTX 2070
Hoffe das hilft anderen mit dem gleichen Problem.