Вкладка «Статистика»

Статистика У що вам обходиться мовна модель — у токенах і в затримці.

Вкладка «Статистика»

Токен — базова одиниця обчислень мовної моделі, приблизно слово або число. Якщо ви користуєтесь платним хмарним провайдером, токени і є лічильником.


Телеметрія LLM

Модель, яка насправді обслуговує ваші запити, і скільки часу триває поточна сесія. Ім'я моделі — це те, що відповіло, а не те, що ви налаштували, тож саме тут ви пересвідчуєтесь, що зміна провайдера справді спрацювала.

Витрата токенів

П'ять смуг. Вони описують останній запит, а не сесію, щоб ви бачили форму одного обміну.

Поле Значення
Останній промпт Надіслані вхідні токени
Остання відповідь Згенеровані вихідні токени
Влучання у кеш Введення, обслужене з кешу замість повторної тарифікації
Записано в кеш Введення, записане у кеш, щоб наступні запити в нього влучали
Остання швидкість Токенів за секунду

Чотири токенні смуги заповнюються як частка від загального обсягу цього одного запиту, тож читаються як склад. У швидкості немає фіксованої стелі, тому її смуга заповнюється відносно найшвидшої відповіді за сесію.

Зведення сесії

Рядок Значення
Токенів використано Позначено (БЕЗКОШТОВНО) для локальної моделі та (платно) для хмарної
Токенів зекономлено кешем Лише хмара. Щойно з'являються влучання, показує «обслужено за зниженим тарифом»
Токенів / годину Прогноз. Перші 10 хвилин показує «збір даних…», бо швидкість, екстрапольована з двох хвилин гри, — це вигадка

Що цифри означають на практиці

Типова сесія загалом іде приблизно по 250 000 токенів на годину.

Хмарна інтеграція Elite Intel налаштована під кожного провайдера на максимальне кешування промптів, а закешовані токени або безкоштовні, або тарифікуються за зниженою ставкою. Яка частка з цих 250 000 потрапить у кеш, цілком залежить від провайдера: одні кешують до 80 %, інші ближче до 40 %. Саме ця різниця здебільшого й відділяє дешевого провайдера від дорогого, і її варто поспостерігати тут протягом сесії, перш ніж на чомусь зупинитися.

У локальної моделі показників кешу немає. Локальний інференс кешує — llama.cpp тримає KV-кеш і використовує його, — але не повідомляє цифри, тож чесно показати нічого. Панель так і пише, замість того щоб виводити оманливий нуль, і повністю приховує рядок кешу.

Живу зведену версію тих самих даних несе вкладка «Вега»: унизу в неї смуга Зведення системи з шести блоків.


Community 👉Matrix👈