Вкладка «Статистика»
У що вам обходиться мовна
модель — у токенах і в затримці.

Токен — базова одиниця обчислень мовної моделі, приблизно слово або число. Якщо ви користуєтесь платним хмарним провайдером, токени і є лічильником.
Телеметрія LLM
Модель, яка насправді обслуговує ваші запити, і скільки часу триває поточна сесія. Ім'я моделі — це те, що відповіло, а не те, що ви налаштували, тож саме тут ви пересвідчуєтесь, що зміна провайдера справді спрацювала.
Витрата токенів
П'ять смуг. Вони описують останній запит, а не сесію, щоб ви бачили форму одного обміну.
| Поле | Значення |
|---|---|
| Останній промпт | Надіслані вхідні токени |
| Остання відповідь | Згенеровані вихідні токени |
| Влучання у кеш | Введення, обслужене з кешу замість повторної тарифікації |
| Записано в кеш | Введення, записане у кеш, щоб наступні запити в нього влучали |
| Остання швидкість | Токенів за секунду |
Чотири токенні смуги заповнюються як частка від загального обсягу цього одного запиту, тож читаються як склад. У швидкості немає фіксованої стелі, тому її смуга заповнюється відносно найшвидшої відповіді за сесію.
Зведення сесії
| Рядок | Значення |
|---|---|
| Токенів використано | Позначено (БЕЗКОШТОВНО) для локальної моделі та (платно) для хмарної |
| Токенів зекономлено кешем | Лише хмара. Щойно з'являються влучання, показує «обслужено за зниженим тарифом» |
| Токенів / годину | Прогноз. Перші 10 хвилин показує «збір даних…», бо швидкість, екстрапольована з двох хвилин гри, — це вигадка |
Що цифри означають на практиці
Типова сесія загалом іде приблизно по 250 000 токенів на годину.
Хмарна інтеграція Elite Intel налаштована під кожного провайдера на максимальне кешування промптів, а закешовані токени або безкоштовні, або тарифікуються за зниженою ставкою. Яка частка з цих 250 000 потрапить у кеш, цілком залежить від провайдера: одні кешують до 80 %, інші ближче до 40 %. Саме ця різниця здебільшого й відділяє дешевого провайдера від дорогого, і її варто поспостерігати тут протягом сесії, перш ніж на чомусь зупинитися.
У локальної моделі показників кешу немає. Локальний інференс кешує — llama.cpp тримає KV-кеш і використовує його, — але не повідомляє цифри, тож чесно показати нічого. Панель так і пише, замість того щоб виводити оманливий нуль, і повністю приховує рядок кешу.
Живу зведену версію тих самих даних несе вкладка «Вега»: унизу в неї смуга Зведення системи з шести блоків.
Community 👉Matrix👈