jsonscraper

Responses API -tokenien kulutuksen laskeminen: syöte, tuloste, välimuisti ja päättely

Käytännön usage-seuranta: näin tarkistat promptin, keskusteluhistorian ja päättelyn optimoinnilla saavutetut säästöt.

Tarkista promptin lyhentämisen jälkeen säästöt kunkin vastauksen usage-tietojen ja koko tehtävän kustannusten perusteella. Lyhyeen vastaukseen voi liittyä huomattava määrä päättelyä, ja keskustelun jatkaminen voi johtaa historian laskemiseen uudelleen. Pidä budjetin seurannassa erillään tokenien määrä, hinnoitteluluokat ja tuloksen saavuttamiseen tarvittujen kutsujen määrä.

Responses API -tokenien kulutuksen laskeminen: syöte, tuloste, välimuisti ja päättely
Konteksti: Tarkastelemme Responses API:n laskureita, kontekstin toistuvaa laskutusta ja kustannuskaavaa. Päättely sisältyy jo output_tokens-määrään; välimuistissa olevat tokenit sisältyvät syötteeseen, ja välimuistin kirjoittamisesta voidaan veloittaa erikseen.
Visuaalinen aihe: Yhteinen tekoälykuvitus venäjän-, englannin- ja saksankielisille versioille. Valokuvantarkka toimituksellinen asetelma: kehittäjän työpöydällä on neljä ryhmää pieniä, läpikuultavia lasisia poletteja; sis
© jsonscraper · Tekoälyllä luotu kuva

Neljä laskuria ja niiden sisäkkäisyys

Käyttöobjektin esimerkissä OpenAI näyttää syötteen, tulosteen ja molempien laskurien erittelyn. Lue niitä näin:

  • input_tokens — tämän kutsun syötetokenien kokonaismäärä, mukaan lukien keskustelun jatkamiseen käytetty konteksti.
  • input_tokens_details.cached_tokens — välimuistista käsitelty osuus syötteestä. Se sisältyy jo arvoon input_tokens.
  • output_tokens — tuotettujen tokenien kokonaismäärä, mukaan lukien päättely.
  • output_tokens_details.reasoning_tokens — tulosteen se osuus, joka käytettiin päättelyyn.

Päättelytokenit sisältyvät jo arvoon output_tokens; niitä ei saa lisätä tulosteeseen toistamiseen. OpenAI veloittaa niistä tulostetokenien hinnan mukaisesti. Vastaavasti cached_tokens-arvon lisääminen syötteeseen laskee saman pyyntöosan kahdesti. Käytä kokonaismääränä arvoa total_tokens tai summaa input_tokens + output_tokens.

Kustannukset: erittele syöte luokittain

Ajantasaisella hinnoittelusivulla tavallinen syöte, välimuistista luettu syöte, välimuistiin kirjoittaminen ja tuloste on esitetty erikseen. Valitse hinnat käytetyn mallin, käsittelytilan ja soveltuvan kontekstin pituuden mukaan. Tallenna tarkat arvot versiohallittuun laskentamääritykseen.

Ajantasaisen välimuistidokumentaation olennainen yksityiskohta: GPT-5.6- ja sitä uudemmissa malleissa huomioidaan input_tokens_details.cache_write_tokens. Jos laskentamallissasi välimuistiin kirjoittamisesta veloitetaan erikseen, vähennä tämä luokka tavallisesta syötteestä ja sovella siihen omaa hintaansa.

I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens

ordinary_input = I - C - W
cost = ((I - C - W) * P_input
        + C * P_cached
        + W * P_write
        + O * P_output) / 1_000_000
Responses API -tokenien kulutuksen laskeminen: syöte, tuloste, välimuisti ja päättely
Konteksti: Tarkastelemme Responses API:n laskureita, kontekstin toistuvaa laskutusta ja kustannuskaavaa. Päättely sisältyy jo output_tokens-määrään; välimuistissa olevat tokenit sisältyvät syötteeseen, ja välimuistin kirjoittamisesta voidaan veloittaa erikseen.
Visuaalinen aihe: Yhteinen tekoälykuvitus venäjän-, englannin- ja saksankielisille versioille. Valokuvantarkka toimituksellinen asetelma: kehittäjän työpöydällä on neljä ryhmää pieniä, läpikuultavia lasisia poletteja; sis
© jsonscraper · Tekoälyllä luotu kuva

Tässä hinnat ilmoitetaan miljoonaa tokenia kohti; jos laskentamallissa ei ole erillistä kirjoitusluokkaa, käytä arvoa W = 0. Kaava kattaa luetellut tokeniluokat. Lisää maksulliset työkalut omille riveilleen niiden hinnoitteluehtojen mukaisesti.

Esimerkki: syöte on 4000, välimuistista luettu syöte 3000, välimuistiin kirjoitettu määrä 500 ja tuloste 1000, josta päättelyä on 600 tokenia. Tavallisia syötetokeneita on siis 500 ja tokeneita yhteensä 5000. Tulosteesta veloitetaan 1000 tokenin mukaan; arvo 600 säilytetään diagnostiikkaa varten.

Keskustelun jatkaminen kuluttaa syötettä uudelleen

Kun sovellus hallitsee keskusteluhistoriaa itse, se lähettää aiemmat viestit uuden syötteen mukana. Seuraavaan pyyntöön sisällytetyt viestit lasketaan uudelleen syötekontekstiksi. Siksi vain viimeisimmän käyttäjäviestin mittaaminen jättää historian kulutuksen huomiotta.

Kun käytetään previous_response_id-kenttää, sovellus välittää viittauksen edelliseen vastaukseen, ja API yhdistää kontekstin. Jatkamisen laskutussääntöjen mukaan ketjun aiemmat syötetokenit laskutetaan uudelleen syötetokeneina. Välimuisti voi muuttaa osan tästä syötteestä toiseen hinnoitteluluokkaan; tarkista kunkin vastauksen cached_tokens-arvosta, osuiko sisältö välimuistiin.

Näin tarkistat optimoinnin tuloksen

  1. Tallenna lähtötason otos. Vertaa samoja tehtäviä, mallia, onnistumiskriteeriä ja pituudeltaan vertailukelpoisia keskusteluja.
  2. Kirjaa jokainen kutsu. Tallenna vastauksen ja tehtävän tunnisteet, malli, päättelyasetukset, tila, viive ja täydelliset usage-tiedot. Tallenna myös promptin ja hinnoitteluasetusten versiot.
  3. Laske tehtävän kokonaiskulut. Sisällytä kaikki tehtävän kutsut ja uudelleenyrityksistä saadut vastaukset. Tärkein mittari on onnistuneesti suoritetun tehtävän hinta.
  4. Erittele muutoksen syyt. Seuraa tavallista syötettä, välimuistista lukemista ja välimuistiin kirjoittamista, tulostetta sekä päättelyn osuutta. Laske välimuistin yhteenlaskettu osuus jakamalla C-arvojen summa I-arvojen summalla.
  5. Tarkista laatu ja jakauman häntä. Vertaa keskimääräisen hinnan lisäksi p95-arvoa, yrityskertojen määrää ja onnistuneiden tehtävien osuutta.

max_output_tokens-parametri rajoittaa generointia yhdessä päättelyn kanssa. Jos raja saavutetaan, vastauksen tila voi olla incomplete, myös silloin, kun näkyvää tekstiä ei ole mutta tokeneita on kulunut. Ota tällaiset vastaukset huomioon säästöjä tarkistaessasi: optimointi onnistuu, kun vertailukelpoiset tehtävät valmistuvat onnistuneesti pienemmillä kokonaiskuluilla.

People

No people listed for this article yet.

Keep readingAnthropic julkaisi Claude Haiku 5.5:n: hinta riippuu kehotteen pituudesta
Read the next article

Muuta lukemasi toimivaksi integraatioksi

Tutustu jsonscraperin sosiaalisen datan rajapintoihin, testaa pyyntöjä ja rakenna seuraava työnkulkusi.

Tutki API:t