allesWas genau mache ich falsch ?
allesWas genau mache ich falsch ?
Was genau mache ich falsch ?
Mal für Dich zum Vergleich gerade durchgeführt:Nachdem ich mein neuen MacBook Pro mit M5 Pro Chip und 48GB RAM bekommen habe, wollte ich mal testen was man lokal laufen lassen kann. Nicht viel. Ausprobiert habe ich DeepSeek R1 Distill 14B was mit guter Performance(30Token/s) läuft. Das 32B (Distill) läuft schon merklich langsam mit gerade mal 15Token/s. Schon wesentlich performanter lief das Qwen 3.5 35B-A3B mit über 40 Token/s und manchmal fast 50. Das Gemma 4 26B-A4B kam mir noch schneller vor, gemessen hatte ich sogar Werte über 50Token/s.
Ich habe das Ollama 0.19+ mit MLX-Backend benutzt. Das ganze schwankte je nach länge des Kontext und wurde mit größeren Kontext bei allen Modellen langsamer. War aber zu erwarten. Die großen Modelle kann man darauf nicht laufen lassen. Ich werde aber mal einige Vergleiche zu minem Mac Studio mit M2 Pro und 128GB RAM machen wenn das Wetter am WE wieder mies ist.
Das wird durch den Einsatzzweck bestimmt ... wenn ich die Leistung nicht brauche ... muss ich sie nicht einkaufen ... ist wie das 30igste TV Abo wenn man nur Netflix schautwarum lässt du das auf looser Hardware laufen? Kauf dir vernünftige Hardware und dann ist die Performance auch besser ...
Was ist denn "loose Hardware" bzw deiner Meinung nach "vernünftige Hardware"??warum lässt du das auf looser Hardware laufen? Kauf dir vernünftige Hardware und dann ist die Performance auch besser ...
Sind halt sehr unterschiedliche Einsatzgebiete ... kann man denke ich ganz gut sehen was allein die Intel mit 32 GB "wegreisst" mit selben Modellen ... da kommen die Apple Geräte nicht mit ... aber für Hintergrundarbeiten sind die ideal vom Preis / Leistungsverhältnis ... zum Beispiel große Indizierungsaufgaben mit OCR oder ähnliches ... die nicht Zeitkritisch sind ...tja ´kann man mit Macs auch machen...aber spätestens wenn man die Stromaufnahme vergleicht weis man was los ist.
Also was Cuda, , das NVIDIA Softwareframework, kann ist schon beeindruckend ... das ist im Moment glaube ich noch der entscheidende Vorteil bei NVIDIAUnd wer jetzt faselt das man auch Nvidia Karten und die DGX Spark zusammenschalten
0.32.166.025 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2048, progress = 0.75, t = 5.05 s / 405.80 tokens per second
0.33.875.776 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2221, progress = 0.81, t = 6.76 s / 328.72 tokens per second
0.34.646.909 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2721, progress = 0.99, t = 7.53 s / 361.47 tokens per second
0.36.373.300 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 2733, progress = 1.00, t = 9.25 s / 295.33 tokens per second
0.40.930.069 I slot print_timing: id 3 | task 0 | n_gen = 100, tg = 24.11 t/s, tg_3s = 24.35 t/s
0.43.944.112 I slot print_timing: id 3 | task 0 | n_gen = 173, tg = 24.15 t/s, tg_3s = 24.22 t/s
0.46.965.544 I slot print_timing: id 3 | task 0 | n_gen = 246, tg = 24.16 t/s, tg_3s = 24.16 t/s
0.49.651.121 I slot print_timing: id 3 | task 0 | prompt eval time = 9703.85 ms / 2737 tokens ( 3.55 ms per token, 282.05 tokens per second)
0.49.651.123 I slot print_timing: id 3 | task 0 | eval time = 12828.07 ms / 311 tokens ( 41.38 ms per token, 24.17 tokens per second)
0.49.651.124 I slot print_timing: id 3 | task 0 | total time = 22531.92 ms / 3048 tokens
0.49.651.124 I slot print_timing: id 3 | task 0 | graphs reused = 309
0.49.651.530 I slot release: id 3 | task 0 | stop processing: n_tokens = 3047, truncated = 0
1.19.943.107 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, f_sim_best = 0.993 (> 0.100 thold), f_keep = 1.000
1.19.944.058 I slot launch_slot_: id 3 | task 316 | processing task, is_child = 0
1.24.617.485 I slot print_timing: id 3 | task 316 | n_gen = 100, tg = 24.08 t/s, tg_3s = 24.32 t/s
1.27.619.161 I slot print_timing: id 3 | task 316 | n_gen = 172, tg = 24.04 t/s, tg_3s = 23.99 t/s
1.30.651.553 I slot print_timing: id 3 | task 316 | n_gen = 245, tg = 24.05 t/s, tg_3s = 24.07 t/s
1.33.685.138 I slot print_timing: id 3 | task 316 | n_gen = 318, tg = 24.05 t/s, tg_3s = 24.06 t/s
1.36.704.527 I slot print_timing: id 3 | task 316 | n_gen = 391, tg = 24.08 t/s, tg_3s = 24.18 t/s
1.39.730.277 I slot print_timing: id 3 | task 316 | n_gen = 464, tg = 24.08 t/s, tg_3s = 24.13 t/s
1.42.763.086 I slot print_timing: id 3 | task 316 | n_gen = 537, tg = 24.08 t/s, tg_3s = 24.07 t/s
1.45.794.549 I slot print_timing: id 3 | task 316 | n_gen = 610, tg = 24.08 t/s, tg_3s = 24.08 t/s
1.48.828.383 I slot print_timing: id 3 | task 316 | n_gen = 683, tg = 24.08 t/s, tg_3s = 24.06 t/s
1.51.860.980 I slot print_timing: id 3 | task 316 | n_gen = 756, tg = 24.08 t/s, tg_3s = 24.07 t/s
1.54.864.326 I slot print_timing: id 3 | task 316 | n_gen = 828, tg = 24.07 t/s, tg_3s = 23.97 t/s
1.57.870.346 I slot print_timing: id 3 | task 316 | n_gen = 900, tg = 24.06 t/s, tg_3s = 23.95 t/s
1.58.164.745 I slot print_timing: id 3 | task 316 | prompt eval time = 561.02 ms / 23 tokens ( 24.39 ms per token, 41.00 tokens per second)
1.58.164.747 I slot print_timing: id 3 | task 316 | eval time = 37659.40 ms / 907 tokens ( 41.57 ms per token, 24.06 tokens per second)
1.58.164.748 I slot print_timing: id 3 | task 316 | total time = 38220.42 ms / 930 tokens
1.58.164.748 I slot print_timing: id 3 | task 316 | graphs reused = 1210
1.58.164.835 I slot release: id 3 | task 316 | stop processing: n_tokens = 3976, truncated = 0
2.04.034.286 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, f_sim_best = 0.984 (> 0.100 thold), f_keep = 1.000
2.04.035.117 I slot launch_slot_: id 3 | task 1226 | processing task, is_child = 0
2.08.749.401 I slot print_timing: id 3 | task 1226 | n_gen = 100, tg = 23.53 t/s, tg_3s = 23.77 t/s
2.11.776.315 I slot print_timing: id 3 | task 1226 | n_gen = 172, tg = 23.64 t/s, tg_3s = 23.79 t/s
2.14.802.285 I slot print_timing: id 3 | task 1226 | n_gen = 244, tg = 23.68 t/s, tg_3s = 23.79 t/s
2.17.829.479 I slot print_timing: id 3 | task 1226 | n_gen = 316, tg = 23.71 t/s, tg_3s = 23.78 t/s
2.20.867.647 I slot print_timing: id 3 | task 1226 | n_gen = 388, tg = 23.70 t/s, tg_3s = 23.70 t/s
2.23.872.213 I slot print_timing: id 3 | task 1226 | n_gen = 459, tg = 23.69 t/s, tg_3s = 23.63 t/s
2.26.904.774 I slot print_timing: id 3 | task 1226 | n_gen = 530, tg = 23.65 t/s, tg_3s = 23.41 t/s
2.29.829.662 I slot print_timing: id 3 | task 1226 | prompt eval time = 506.24 ms / 63 tokens ( 8.04 ms per token, 124.45 tokens per second)
2.29.829.664 I slot print_timing: id 3 | task 1226 | eval time = 25288.07 ms / 598 tokens ( 42.36 ms per token, 23.61 tokens per second)
2.29.829.673 I slot print_timing: id 3 | task 1226 | total time = 25794.31 ms / 661 tokens
2.29.829.675 I slot print_timing: id 3 | task 1226 | graphs reused = 1803
2.29.829.795 I slot release: id 3 | task 1226 | stop processing: n_tokens = 4636, truncated = 0
Follow along with the video below to see how to install our site as a web app on your home screen.
Anmerkung: This feature may not be available in some browsers.