Künstliche Intelligenz (KI,AI) Neuigkeiten und Diskussion

Was genau mache ich falsch ?

z.B. das:

 
  • 555
  • Like
Reactions: 1 users
Nachdem ich mein neuen MacBook Pro mit M5 Pro Chip und 48GB RAM bekommen habe, wollte ich mal testen was man lokal laufen lassen kann. Nicht viel. Ausprobiert habe ich DeepSeek R1 Distill 14B was mit guter Performance(30Token/s) läuft. Das 32B (Distill) läuft schon merklich langsam mit gerade mal 15Token/s. Schon wesentlich performanter lief das Qwen 3.5 35B-A3B mit über 40 Token/s und manchmal fast 50. Das Gemma 4 26B-A4B kam mir noch schneller vor, gemessen hatte ich sogar Werte über 50Token/s.

Ich habe das Ollama 0.19+ mit MLX-Backend benutzt. Das ganze schwankte je nach länge des Kontext und wurde mit größeren Kontext bei allen Modellen langsamer. War aber zu erwarten. Die großen Modelle kann man darauf nicht laufen lassen. Ich werde aber mal einige Vergleiche zu minem Mac Studio mit M2 Pro und 128GB RAM machen wenn das Wetter am WE wieder mies ist.

Was die Ergebnisse, also die Qualität des abgelieferten Codes angeht war ich nicht positiv überascht, das ganze hat eher meine geringen Erwartungen bestätigt. Für einfache Aufgaben ok, aber aus einem Text einen komplexeren Algorithmus ableiten und in Code schreiben war eher ein Reinfall. Also wer sowas vor hat der sollte das Geld lieber in Token für ein Model oder einen Service wie Openrouter oder Cloudflare AI Router investieren.
 
  • Like
Reactions: 1 user
warum lässt du das auf looser Hardware laufen? Kauf dir vernünftige Hardware und dann ist die Performance auch besser ...
 
Nachdem ich mein neuen MacBook Pro mit M5 Pro Chip und 48GB RAM bekommen habe, wollte ich mal testen was man lokal laufen lassen kann. Nicht viel. Ausprobiert habe ich DeepSeek R1 Distill 14B was mit guter Performance(30Token/s) läuft. Das 32B (Distill) läuft schon merklich langsam mit gerade mal 15Token/s. Schon wesentlich performanter lief das Qwen 3.5 35B-A3B mit über 40 Token/s und manchmal fast 50. Das Gemma 4 26B-A4B kam mir noch schneller vor, gemessen hatte ich sogar Werte über 50Token/s.

Ich habe das Ollama 0.19+ mit MLX-Backend benutzt. Das ganze schwankte je nach länge des Kontext und wurde mit größeren Kontext bei allen Modellen langsamer. War aber zu erwarten. Die großen Modelle kann man darauf nicht laufen lassen. Ich werde aber mal einige Vergleiche zu minem Mac Studio mit M2 Pro und 128GB RAM machen wenn das Wetter am WE wieder mies ist.
Mal für Dich zum Vergleich gerade durchgeführt:
Anhang anzeigen 1789758059599.png

B70 ist eine Intel GraKa mit 32 GB VRAM auf einem I7 : M4 ist ein standart Apple Silicon mit 16 GB ... deine Werte für den M5 sind voll in der Erwartung @oldsleepi ... denk aber Du hast zuviel erwartet von deinem Modell ... die sind super für Hintergrund Arbeiten ... aber damit "chatten" in RT ist schwierig

warum lässt du das auf looser Hardware laufen? Kauf dir vernünftige Hardware und dann ist die Performance auch besser ...
Das wird durch den Einsatzzweck bestimmt ... wenn ich die Leistung nicht brauche ... muss ich sie nicht einkaufen ... ist wie das 30igste TV Abo wenn man nur Netflix schaut
 
  • Like
Reactions: 1 user
warum lässt du das auf looser Hardware laufen? Kauf dir vernünftige Hardware und dann ist die Performance auch besser ...
Was ist denn "loose Hardware" bzw deiner Meinung nach "vernünftige Hardware"??

Ich wollte halt mal wieder ein neues Laptop, wollte nur mal schauen was der M5 Pro Chips so kann. Für meine KI Experimente hatte ich mir schon vor 3 Jahren einen Studio mit M2 Ultra und 128Gb Ram gekauft. Der reicht für meine gelegentlichen Spielereien noch immer.
Die aktuellen Mac Studios sind "die" Hardware die im AI Bereich die überhaupt große Modelle laden können. Das aktuelle Model kann man mit 512GB Ram bestellen, wenn man das nötige Kleingeld hat. Und wer jetzt faselt das man auch Nvidia Karten und die DGX Spark zusammenschalten könnte um den Speicher zu erhöhen, tja ´kann man mit Macs auch machen...aber spätestens wenn man die Stromaufnahme vergleicht weis man was los ist.

Übrigens, wer sich für AI/KI interessiert und mal sehen will wie weit es schon bei Thema AI generierte Filme ist, einfach mal bei You nach Higgsfield Global AI Film Festival suche. Es gibt zig eindrucksvolle Kurzfilme.
 
Zuletzt bearbeitet:
tja ´kann man mit Macs auch machen...aber spätestens wenn man die Stromaufnahme vergleicht weis man was los ist.
Sind halt sehr unterschiedliche Einsatzgebiete ... kann man denke ich ganz gut sehen was allein die Intel mit 32 GB "wegreisst" mit selben Modellen ... da kommen die Apple Geräte nicht mit ... aber für Hintergrundarbeiten sind die ideal vom Preis / Leistungsverhältnis ... zum Beispiel große Indizierungsaufgaben mit OCR oder ähnliches ... die nicht Zeitkritisch sind ...

Und wer jetzt faselt das man auch Nvidia Karten und die DGX Spark zusammenschalten
Also was Cuda, , das NVIDIA Softwareframework, kann ist schon beeindruckend ... das ist im Moment glaube ich noch der entscheidende Vorteil bei NVIDIA
 
  • Like
Reactions: 1 user
Wie du schon schreibst, kommt auf den Fall an. Reine GPU Power, ja da liegt NVidia vorne. Aber ein großes Modell laden ohne 10kW Strom zu verbrauchen, naja. Die Frage wird halt sein was man von Apple AI Kernen noch erwarten kann.
Da kommt man auch schnell zum Thema Äpfel mit Birnen vergleichen. Ich kann zwar die kleinen Modelle auch im Mac Studio laufen lassen aber die großen eben nicht auf dem M5 Pro weil der Speicher fehlt. Ist es dann noch ein fairer Vergleich?!

Aber selbst wenn ich morgen im Lotto gewinnen würde, so würde ich mir wohl so schnell keinen neuen Mac Studio, vor allem aber nicht mit 512GB Ram kaufen :D
 
  • Like
Reactions: 1 user
Mal wieder was interessantes zum Thema gefunden, wenn das mit dem Bonsai Model nur für alle LLM gehen würde:

Auch den Vergleich der neuen Mac ist ganz interessant, aber vom Preis her ist es mir nicht Wert.
 
Ich habe die BonsaI Demo aus dem ersten Video mal auf dem MacBook M5 Pro getestet. Kann man mit arbeiten, wird aber auf einer RTX sicher viel performanter laufen. Wenn ich am WE mal wieder Lust habe spiele ich noch etwas herum. Das ganze in Visual Studio Code ein zu binden sollte nicht zu schwer sein, dann kann man mal die Coding Fähigkeiten testen.
0.32.166.025 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2048, progress = 0.75, t = 5.05 s / 405.80 tokens per second

0.33.875.776 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2221, progress = 0.81, t = 6.76 s / 328.72 tokens per second

0.34.646.909 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2721, progress = 0.99, t = 7.53 s / 361.47 tokens per second

0.36.373.300 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2733, progress = 1.00, t = 9.25 s / 295.33 tokens per second

0.40.930.069 I slot print_timing: id 3 | task 0 | n_gen = 100, tg = 24.11 t/s, tg_3s = 24.35 t/s

0.43.944.112 I slot print_timing: id 3 | task 0 | n_gen = 173, tg = 24.15 t/s, tg_3s = 24.22 t/s

0.46.965.544 I slot print_timing: id 3 | task 0 | n_gen = 246, tg = 24.16 t/s, tg_3s = 24.16 t/s

0.49.651.121 I slot print_timing: id 3 | task 0 | prompt eval time = 9703.85 ms / 2737 tokens ( 3.55 ms per token, 282.05 tokens per second)

0.49.651.123 I slot print_timing: id 3 | task 0 | eval time = 12828.07 ms / 311 tokens ( 41.38 ms per token, 24.17 tokens per second)

0.49.651.124 I slot print_timing: id 3 | task 0 | total time = 22531.92 ms / 3048 tokens

0.49.651.124 I slot print_timing: id 3 | task 0 | graphs reused = 309

0.49.651.530 I slot release: id 3 | task 0 | stop processing: n_tokens = 3047, truncated = 0

1.19.943.107 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, f_sim_best = 0.993 (> 0.100 thold), f_keep = 1.000

1.19.944.058 I slot launch_slot_: id 3 | task 316 | processing task, is_child = 0

1.24.617.485 I slot print_timing: id 3 | task 316 | n_gen = 100, tg = 24.08 t/s, tg_3s = 24.32 t/s

1.27.619.161 I slot print_timing: id 3 | task 316 | n_gen = 172, tg = 24.04 t/s, tg_3s = 23.99 t/s

1.30.651.553 I slot print_timing: id 3 | task 316 | n_gen = 245, tg = 24.05 t/s, tg_3s = 24.07 t/s

1.33.685.138 I slot print_timing: id 3 | task 316 | n_gen = 318, tg = 24.05 t/s, tg_3s = 24.06 t/s

1.36.704.527 I slot print_timing: id 3 | task 316 | n_gen = 391, tg = 24.08 t/s, tg_3s = 24.18 t/s

1.39.730.277 I slot print_timing: id 3 | task 316 | n_gen = 464, tg = 24.08 t/s, tg_3s = 24.13 t/s

1.42.763.086 I slot print_timing: id 3 | task 316 | n_gen = 537, tg = 24.08 t/s, tg_3s = 24.07 t/s

1.45.794.549 I slot print_timing: id 3 | task 316 | n_gen = 610, tg = 24.08 t/s, tg_3s = 24.08 t/s

1.48.828.383 I slot print_timing: id 3 | task 316 | n_gen = 683, tg = 24.08 t/s, tg_3s = 24.06 t/s

1.51.860.980 I slot print_timing: id 3 | task 316 | n_gen = 756, tg = 24.08 t/s, tg_3s = 24.07 t/s

1.54.864.326 I slot print_timing: id 3 | task 316 | n_gen = 828, tg = 24.07 t/s, tg_3s = 23.97 t/s

1.57.870.346 I slot print_timing: id 3 | task 316 | n_gen = 900, tg = 24.06 t/s, tg_3s = 23.95 t/s

1.58.164.745 I slot print_timing: id 3 | task 316 | prompt eval time = 561.02 ms / 23 tokens ( 24.39 ms per token, 41.00 tokens per second)

1.58.164.747 I slot print_timing: id 3 | task 316 | eval time = 37659.40 ms / 907 tokens ( 41.57 ms per token, 24.06 tokens per second)

1.58.164.748 I slot print_timing: id 3 | task 316 | total time = 38220.42 ms / 930 tokens

1.58.164.748 I slot print_timing: id 3 | task 316 | graphs reused = 1210

1.58.164.835 I slot release: id 3 | task 316 | stop processing: n_tokens = 3976, truncated = 0

2.04.034.286 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, f_sim_best = 0.984 (> 0.100 thold), f_keep = 1.000

2.04.035.117 I slot launch_slot_: id 3 | task 1226 | processing task, is_child = 0

2.08.749.401 I slot print_timing: id 3 | task 1226 | n_gen = 100, tg = 23.53 t/s, tg_3s = 23.77 t/s

2.11.776.315 I slot print_timing: id 3 | task 1226 | n_gen = 172, tg = 23.64 t/s, tg_3s = 23.79 t/s

2.14.802.285 I slot print_timing: id 3 | task 1226 | n_gen = 244, tg = 23.68 t/s, tg_3s = 23.79 t/s

2.17.829.479 I slot print_timing: id 3 | task 1226 | n_gen = 316, tg = 23.71 t/s, tg_3s = 23.78 t/s

2.20.867.647 I slot print_timing: id 3 | task 1226 | n_gen = 388, tg = 23.70 t/s, tg_3s = 23.70 t/s

2.23.872.213 I slot print_timing: id 3 | task 1226 | n_gen = 459, tg = 23.69 t/s, tg_3s = 23.63 t/s

2.26.904.774 I slot print_timing: id 3 | task 1226 | n_gen = 530, tg = 23.65 t/s, tg_3s = 23.41 t/s

2.29.829.662 I slot print_timing: id 3 | task 1226 | prompt eval time = 506.24 ms / 63 tokens ( 8.04 ms per token, 124.45 tokens per second)

2.29.829.664 I slot print_timing: id 3 | task 1226 | eval time = 25288.07 ms / 598 tokens ( 42.36 ms per token, 23.61 tokens per second)

2.29.829.673 I slot print_timing: id 3 | task 1226 | total time = 25794.31 ms / 661 tokens

2.29.829.675 I slot print_timing: id 3 | task 1226 | graphs reused = 1803

2.29.829.795 I slot release: id 3 | task 1226 | stop processing: n_tokens = 4636, truncated = 0
 
Menü
Zurück
Oben Unten