metal : use shared buffers between CPU and GPU (#1696)

* Use MTLDevice.newBufferWithBytesNoCopy to share buffers between CPU and GPU * Page-align buffers used by Metal * Remove trailing whitespace * Only import unistd.h for Metal builds * metal : remove unnecessary copies --------- Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
2025-08-18 05:56:00 -04:00 · 2023-06-05 13:24:04 -07:00
parent efe0507632
commit 9d0693bce3
4 changed files with 38 additions and 16 deletions
--- a/llama-util.h
+++ b/llama-util.h
@@ -405,13 +405,29 @@ struct llama_buffer {
    llama_buffer() = default;

    void resize(size_t len) {
+#ifdef GGML_USE_METAL
+        free(addr);
+        int result = posix_memalign((void **) &addr, getpagesize(), len);
+        if (result == 0) {
+            memset(addr, 0, len);
+        }
+        else {
+            addr = NULL;
+        }
+#else
        delete[] addr;
        addr = new uint8_t[len];
+#endif
        size = len;
    }

    ~llama_buffer() {
+#ifdef GGML_USE_METAL
+        free(addr);
+#else
        delete[] addr;
+#endif
+        addr = NULL;
    }

    // disable copy and move