from tokensense import observe
from tokensense.cache import SQLiteVectorCache
import openai
# Initialize the cache database
cache = SQLiteVectorCache("./tokensense.db")
# Pass the cache to the observe wrapper
client = observe(openai.OpenAI(), cache=cache)
# First call: hits OpenAI API and incurs cost & latency
response1 = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Explain async/await"}]
)
# Second call: intercepted instantly, latency ~1ms, cost $0.00
response2 = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Explain async/await"}]
)