Radar technologii AI
Technologie, które obserwujemy, i jak blisko są naszych produktów.
- Stosujemy (0)Nadaje się do naszych produktów.
- Testujemy (0)Prowadzimy testy praktyczne.
- Oceniamy (16)Wygląda obiecująco — wymaga analizy.
- Obserwujemy (0)Obserwujemy technologię.
Modele
- GLM 5.3Oceniamy
Nowo udostępniony model warto szybko sprawdzić (rozumowanie, wywoływanie narzędzi, opóźnienie, koszt), aby ocenić, czy pasuje do agentów głosowych lub automatyzacji, choć źródło nie podaje żadnych specyfikacji do wstępnej oceny.
- Gemini Omni FlashOceniamy
Nazwa i odnośnik do 'omni guide' sugerują model multimodalny, który może być istotny dla rozwiązań Voice AI, gdy pojawią się konkretne informacje o obsłudze dźwięku, opóźnieniach i cenach.
- GitHub Security Lab Taskflow AgentOceniamy
To otwartoźródłowy agent AI do audytu bezpieczeństwa z konfigurowalnymi przepływami promptów, który wykrywa nie tylko typowe, ale i logiczne klasy podatności; zespół bezpieczeństwa lub deweloperski mógłby uruchomić go na własnym kodzie (serwery web, API, aplikacje mobilne) przed audytem.
Rozpoznawanie mowy (STT)
- NVIDIA NeMo ASR fine-tuning recipe (replay mixing + partial encoder unfreezing + bucketing)Oceniamy
Workflow pokazuje praktyczne, odtwarzalne podejście do adaptacji wielojęzycznego, strumieniowego modelu ASR do konkretnego dialektu/akcentu bez degradacji innych języków — bezpośrednio stosowalne do poprawy dokładności transkrypcji języka litewskiego lub akcentów regionalnych dla zespołów prowadzących głosowych agentów AI.
Synteza mowy (TTS)
- Open TTS LeaderboardOceniamy
Użyj go do porównania wielojęzycznych modeli TTS i klonowania głosu pod względem word error rate oraz metryk jakości w różnych językach, co może pomóc w wyborze modelu TTS dla agentów głosowych.
- Suno SpeechOceniamy
Mogłoby zostać ocenione jako alternatywny silnik TTS dla treści w stylu lektorskim, choć jest skierowane do konsumentów i łączy głos z muzyką, zamiast być czystym silnikiem TTS do dialogów/IVR.
Agenci
- Amazon Bedrock AgentCore Gateway with Web Search (MCP connector)Oceniamy
Pokazuje zarządzany, bezpieczny wzorzec zapewniania agentowi opartemu na MCP dostępu do narzędzi (wyszukiwania internetowego) z uwierzytelnianiem JWT/SSO klasy enterprise, co jest bezpośrednio istotne dla budowy bezpiecznych agentów wywołujących narzędzia za systemami tożsamości korporacyjnej.
- Antigravity SDK local model support (Gemma 4 26B A4B + LiteRT)Oceniamy
Umożliwia uruchamianie agentowych przepływów pracy całkowicie offline/na urządzeniu, redukując koszty API i utrzymując dane lokalnie — istotne przy testowaniu architektur hybrydowych, w których wrażliwe dane połączeń lub logika wywoływania narzędzi pozostają on-premise, podczas gdy model chmurowy zajmuje się planowaniem.
- Claude Sonnet 5.5Oceniamy
Zespoły korzystające z Claude do agentów wywołujących narzędzia lub łańcuchów rozumowania powinny sprawdzić konfigurację myślenia, wymuszone wywołania narzędzi oraz zachowanie bloków myślenia między kontami przed aktualizacją, ponieważ kilka rzeczy zmieniło się względem Sonnet 5.
- Computer use in Agents APIOceniamy
Jeśli budujesz agentów, którzy muszą przeglądać strony internetowe, wypełniać formularze lub wykonywać wieloetapowe zadania webowe (np. sprawdzać status zamówienia w portalu partnera podczas rozmowy), ta funkcja pozwala agentowi działać w prawdziwej przeglądarce bez własnego scrapingu. Warto sprawdzić, jak zatwierdzenia dostępu i logowanie integrują się z logiką Twojej aplikacji oraz jak szybka i niezawodna jest hostowana przeglądarka przy zadaniach wrażliwych na czas, np. podczas trwającej rozmowy.
- GPT-6 Astra UltrafastOceniamy
Szybsze generowanie tokenów mogłoby znacząco skrócić pętle agentowe edycja-test-debugowanie oraz czas odpowiedzi przy wywoływaniu narzędzi, co ma bezpośrednie znaczenie dla agentów głosowych i automatyzacyjnych wrażliwych na opóźnienia.
- Gemini 4 ArgonOceniamy
Silne wywoływanie narzędzi, rozumowanie długoterminowe oraz wysoki wynik w AutomationBench Zapiera mogą uczynić go przydatnym jako podstawę rozumowania dla złożonej, wieloetapowej automatyzacji call center i przepływów agentowych, choć nie jest jeszcze powszechnie dostępny.
- Google Cloud API Gateway MCP supportOceniamy
Zespoły budujące agentów głosowych mogłyby udostępniać istniejące backendy REST (CRM, status zamówień, analityka połączeń) jako narzędzia MCP bez budowania osobnego serwera MCP, upraszczając integrację tool-calling dla agentów głosowych zbudowanych na ADK lub podobnych frameworkach.
- Google Cloud CLI remote MCP serverOceniamy
Zespoły prowadzące agentów głosowych/contact center mogłyby ocenić wykorzystanie zdalnego serwera MCP, aby bezpiecznie wyzwalać operacje infrastruktury chmurowej lub BigQuery (np. logowanie, analityka, planowanie) za pomocą tool calling bez zarządzania lokalnymi zależnościami CLI.
- Holo4 agentic models (27B / 35B-A3B) and Holotron4 NanoOceniamy
Zespoły budujące agentów AI z wywoływaniem narzędzi/funkcji oraz integracjami MCP mogą uznać zdolność Holo4 do łączenia interakcji GUI, kodu i MCP/API w jednym modelu przy niższym koszcie za istotną dla automatyzacji przepływów backendowych/CRM obok agentów głosowych, choć nie jest to model przeznaczony specjalnie do głosu.
- ProvenanceGuard (source-aware verification for MCP agents)Oceniamy
Agenci głosowi/contact-center często pobierają fakty z wielu narzędzi/źródeł CRM; kontrole przypisania źródła świadome kontekstu mogłyby ograniczyć błędne cytowanie źródeł w podsumowaniach rozmów i odpowiedziach, co ma znaczenie dla zaufania i QA.